合成数据时代正在来临？谷歌终止了与 AI 数据公司的合同

合成数据时代正在来临？谷歌终止了与AI数据公司的合同谷歌终止了与AI训练数据公司Appen的合同，该公司拥有一个由100万自由职业者组成的数据标注平台，为微软、苹果、Meta、谷歌和亚马逊等科技巨头训练了各式人工智能产品，也是谷歌获取质量评估员最大的来源之一。Appen在2023年的销售额为2.73亿美元，其中与谷歌合作的收入就占近三分之一，公告发布后Appen股价下跌了40%。投稿：@TNSubmbot频道：@TestFlightCN

在Telegram中查看

相关推荐

Hugging Face 开源“世界最大”AI 训练合成数据集 Cosmopedia

HuggingFace开源“世界最大”AI训练合成数据集CosmopediaHuggingFace近日开源了一款名为“Cosmopedia”的 AI 训练数据集，号称是目前世界上最大的合成数据集。该数据集内容均由Mixtral7b模型汇总生成，其中包含大量教科书、博客文章、故事小说、WikiHow教程，共计250亿个Token。HuggingFace表示，这次开源的数据集为0.1版本，未来团队还将持续更新该数据集，推进业界 AI 训练发展。项目地址：消息来源：线索：@ZaiHuabot投稿：@TNSubmbot频道：@TestFlightCN

消息称社交平台 Reddit 授权数据给谷歌训练 AI，每年 6000 万美元

消息称社交平台Reddit授权数据给谷歌训练AI，每年6000万美元路透社报道，社交媒体平台Reddit已经与谷歌达成协议，使其内容可用于培训谷歌的人工智能模型。这项合同价值约每年6000万美元（当前约4.31亿元人民币）。去年，Reddit表示将对其API的访问收取费用，导致大量第三方客户端停止开发。此次Reddit与谷歌达成的协议，是其与大型AI公司的首次公开交易。线索：@ZaiHuabot投稿：@TNSubmbot频道：@TestFlightCN

知名电子合同平台DocuSign使用客户数据训练AI

知名电子合同平台DocuSign使用客户数据训练AIDocuSign日前透露该公司使用客户提交的各种合同数据来训练人工智能模型，但DocuSign承诺数据会进行匿名化处理。DocuSign主要提供的是无纸化合同服务，各种协议和合同都可以通过DocuSign平台签署，包括电子签名等。按惯例这是要取得用户同意的，然而这些选项似乎都放在了使用协议里，但大多数用户可能没阅读使用协议就同意了。DocuSign没有提供如何退出数据被拿去训练AI的选项。线索：@ZaiHuabot投稿：@TNSubmbot频道：@TestFlightCN

微软、OpenAI用上“数据永动机” 合成数据是蜜糖还是砒霜？

微软、OpenAI用上“数据永动机”合成数据是蜜糖还是砒霜？已有的（通用）数据资源似乎接近效能极限，开发人员认为，网络上那些通用数据已不足以推动AI模型的性能发展。Gomez便指出，网络极为嘈杂混乱，“它并不能为你提供你真正想要的数据，网络无法满足我们的一切需求。”之前，ChatGPT、Bard等聊天机器人的训练数据多来自于互联网，例如电子书、新闻文章、博客、Twitter与Reddit的推文帖子、Youtube视频、Flickr图片等。但随着AIGC技术愈发复杂，高质量数据的获取难度也越来越大。开发AI模型的科技公司们，也因不当使用数据而遭受多方抨击。今年5月的一场活动上，OpenAI首席执行官SamAltman曾被问及，是否担心监管部门调查ChatGPT可能侵犯用户隐私的事。Altman对此不置可否，并表示自己“非常有信心，很快所有数据都将是合成数据”。▌人类真实数据售价高昂为了大幅提高AI模型的性能，提升它们在科学、医学、商业等领域的水平，AI模型需要的是“独特且复杂”的数据集。而这类数据或是需要来自科学家、医生、作家、演员、工程师等“内行人”，或是需要从药企、银行、零售商等大型企业获取专业数据。这也就带来了让AI公司们转向合成数据的另一层原因——数据太贵了。且不说那些技术含量极高的制药、科学数据，光是之前Reddit和Twitter给出的数据采集要价，都被Gomez“嫌弃”价格太高。其中，Reddit本月起开始对数据接口使用收费。根据第三方软件Apollo的开发者ChristianSelig透露，Reddit收费标准为0.24美元/1000次API响应——对于Apollo来说，这大约相当于200万美元/月开销。而根据Twitter今年3月发布的API政策，企业需要为抓取推文的API支付每月4万美元至20万美元不等的费用，对应可以获得5000万至2亿条推文。而测算数据显示，最低一个档次的套餐只约等于整体推文的0.3%。在这种情况下，合成数据自然成了一个实惠方案，不仅可以避开这些数据的高昂售价，还能生成一些更复杂的数据来训练AI。▌如何用合成数据训练？具体如何用合成数据训练AI大模型？Gomez举了一个例子：在训练一个高级数学模型时，Cohere可能会使用两个AI模型进行对话，其中一个扮演数学老师，另一个则充当学生。之后这两个模型就会就三角函数等数学问题对话，“其实一切都是模型‘想象’出来的”。如果在这个过程中，模型说错了什么，人类就会在查看这段对话时作出纠正。而微软研究院最近的两项研究，也表明合成数据可以用来训练AI模型，这些模型一般比OpenAI的GPT-4、Google的PaLM-2更小更简单。在其中一篇论文中，GPT-4生成了一个名为“TinyStories”的短篇故事合成数据集，里面使用的单词全部非常简单，一个四岁儿童都能理解。这一数据集被用来训练一个简单的大语言模型，后者能生成流畅且语法正确的故事。另一篇论文中，AI可以通过合成的Python代码进行训练，并在之后的编码任务中给出相对较好的表现。▌蜜糖还是砒霜？想要合成数据的客户有了，供应商自然也如雨后春笋般涌现，例如ScaleAI、Gretel.ai等初创公司。Gretel.ai由来自美国国安局和中情局的前情报分析师成立，其已与Google、汇丰银行、RiotGames、Illumina等公司合作，用合成数据来扩充现有数据，帮助训练人工智能模型。Gretel.ai首席执行官AliGolshan表示，合成数据的关键在于，它既能保护数据集中所有个人的隐私，又能保持数据的统计完整性。同时，合成数据还可以消除现有数据中的偏差和不平衡。“举例来说，对冲基金可以研究黑天鹅事件，我们可以创建一百种变体，看看模型能否破解；而对于银行来说，欺诈事件通常不到总数据的百分之一，Gretel的软件可以生成成千上万的欺诈案例，并以此训练AI模型。”不过，也有人不看好合成数据。反对派认为，并不是所有合成数据都经过精心调试，并能反映或改进真实世界。来自牛津、剑桥、帝国理工等机构研究人员发现，合成数据的负面影响甚至堪比“毒药”。如果在训练时大量使用AI内容，会引发模型崩溃（modelcollapse），造成不可逆的缺陷。新一代模型的训练数据会被上一代模型的生成数据所污染，从而对现实世界的感知产生错误理解。随着时间推移，模型就会忘记真实基础数据部分。即使在几乎理想的长期学习状态下，这个情况也无法避免——研究人员也将此形容为“AI大模型患上‘痴呆症’”。即便是合成数据从业人员Golshan也坦承，在劣质合成数据上进行训练可能会阻碍进步。“网上越来越多的内容都是由AI生成的。随着时间推移，这确实会导致退化，因为这些大模型产生的知识都是重复的，没有任何新的见解。...PC版：https://www.cnbeta.com.tw/articles/soft/1372401.htm手机版：https://m.cnbeta.com.tw/view/1372401.htm

知名电子合同平台DocuSign拿客户签署的机密合同去训练AI

知名电子合同平台DocuSign拿客户签署的机密合同去训练AI企业不需要使用传统方式打印合同、签订、寄送或者通过传真方式发送，使用DocuSign平台这种商务领域的东西确实可以被简化。使用OpenAI的GPT模型：DocuSign称该公司选择与微软合作，使用微软在云端提供的OpenAIGPT模型，也就是MicrosoftAzureOpenAI服务。使用GPT模型是用来帮助DocuSign训练自己的内部AI，而微软那边则向DocuSign承诺此类企业级AI服务不会收集客户的数据拿去训练GPT。DocuSign内部AI：该公司还使用客户提交的各种数据来训练DocuSign内部专有的AI，内部专有的AI指的是不会公开发布的那种AI。当然按惯例这是要取得用户同意的，然而这些选项似乎都放在使用协议里，估计大多数用户也没仔细阅读使用协议就已经同意。另一方面DocuSign强调使用客户的数据会先进行匿名化和去识别化，也就是这数据无法归因到特定的人或企业，以此来保证数据安全。但这种话说出来也就听听而已，毕竟合同这类数据，有些是具有独特文本内容的，这些内容本身就不应该被泄露。最后，DocuSign没有提供如何退出数据被拿去训练AI的选项。...PC版：https://www.cnbeta.com.tw/articles/soft/1421971.htm手机版：https://m.cnbeta.com.tw/view/1421971.htm

谷歌顶级AI专家加入OpenAI 曾警告不要用ChatGPT数据训练Bard

谷歌顶级AI专家加入OpenAI曾警告不要用ChatGPT数据训练Bard谷歌发言人则表示，“训练Bard没有用过任何来自ShareGPT或ChatGPT的数据。”据悉，用户可以在ShareGPT这个平台上发布他们与聊天机器人ChatGPT所交流的信息。报道称，德弗林曾告诉谷歌高管们，他认为开发Bard的团队使用了来自ShareGPT平台的信息。德弗林警告高管们，用用户与ChatGPT对话进行训练的话，可能会让Bard和ChatGPT太过相似。据报道，德弗林以及谷歌其他员工还认为这种做法违反了OpenAI的服务条款。消息人士表示，在德弗林就这个问题对谷歌高管发出警告后，谷歌就停止使用这些数据来训练Bard。据悉，今年1月份德弗林离开谷歌后不久，就加入了竞争对手OpenAI麾下。此前有报道称，德弗林是今年年初离开谷歌加入竞争对手的几名人工智能顶级研究人员之一。德弗林在谷歌工作了五年多时间。2018年他作为主要作者发布了一篇关于训练机器学习模型以提高搜索精度的研究论文，在一定程度上推动了人工智能的研究热潮。据报道，德弗林的研究成果已经成为谷歌和OpenAI语言模型的组成部分。多年来，OpenAI聘请了几十名来自谷歌母公司Alphabet的员工。去年11月份，OpenAI因公开发布能撰写文章还能自动编程的ChatGPT而爆火，此后谷歌和OpenAI就在人工智能领域展开激烈竞争。本月早些时候，谷歌向部分美国和英国用户发布了Bard。但是谷歌想要赶超OpenAI的步伐并没有停止。有报道称，为了能和OpenAI竞争，隶属于Alphabet旗下的两个人工智能团队DeepMind和谷歌大脑（GoogleBrain）已经联手。（辰辰）...PC版：https://www.cnbeta.com.tw/articles/soft/1352121.htm手机版：https://m.cnbeta.com.tw/view/1352121.htm

🔍 发送关键词来寻找群组、频道或视频。

启动SOSO机器人