Meta 开源最新的 Llama 3.1 大模型

Meta 开源最新的 Llama 3.1 大模型其它科技公司都想把 AI 产品买给你们，但扎克伯格（Mark Zuckerberg）选择免费送给你们。Meta 周一宣布了其最新的 Llama 3.1 大模型，其最大规模版本的参数有 4050 亿个，较小规模的版本有 700 亿和 80 亿个参数。Meta 称，Llama 3.1 在基准测试中的表现超过了 OpenAI 的 GPT-4o 和 Anthropic 的 Claude 3.5 Sonnet。Meta 表示，Llama 3.1 使用了逾 16,000 个英伟达 H100 GPU 进行训练，它认为相比私有大模型，部署成本会更低。扎克伯格称他与世界各地的开发者、企业和政府官员交流时，他们都表达了不希望被私有封闭供应商锁定的愿望，希望自己能控制模型，而 Llama 3.1 将能满足他们的要求。 via Solidot

在Telegram中查看

相关推荐

4050亿参数 Meta或将7月23日发布迄今最强大Llama 3模型

4050亿参数 Meta或将7月23日发布迄今最强大Llama 3模型 Meta公司拒绝对上述消息置评。周五盘中，低开的Meta股价跌幅收窄，盘初曾跌3.6%，午盘跌不足2%，仍将在周四大幅回落超4%后连跌两日，或将刷新6月28日以来收盘低位。去年7月Meta发布的Llama 2有三个版本，最大版本70B的参数规模为700亿。今年4月，Meta发布Llama 3Meta，称它为“迄今为止能力最强的开源LLM”。当时推出的Llama 3有8B和70B两个版本。Meta CEO扎克伯格当时称，大版本的Llama 3将有超过4000亿参数。Meta并未透露会不会将4000亿参数规模的Llama 3开源，当时它还在接受训练。对比前代，Llama 3有了质的飞跃。Llama 2使用2万亿个 token进行训练，而训练Llama 3大版本的token超过15 万亿。Meta称，由于预训练和训练后的改进，其预训练和指令调优的模型是目前8B和70B两个参数规模的最佳模型。在训练后程序得到改进后，模型的错误拒绝率（FRR）大幅下降，一致性提高，模型响应的多样性增加。在推理、代码生成和指令跟踪等功能方面，Llama 3相比Llama 2有极大改进，使Llama 3更易于操控。4月Meta展示，8B和70B版本的Llama 3指令调优模型在大规模多任务语言理解数据集（MMLU）、研究生水平专家推理（GPQA）、数学评测集（GSM8K）、编程多语言测试（HumanEval）等方面的测评得分都高于Mistral、谷歌的Gemma和Gemini和Anthropic的Claude 3。8B和70B版本的预训练Llama 3多种性能测评优于Mistral、Gemma、Gemini和Mixtral。当时社交媒体的网友评论称，根据基准测试，当前的Llama 3模型不完全是 GPT-4 级别的，但仍在训练中的较大尺寸的模型将达到 GPT-4 级别。英伟达高级科学家Jim Fan认为，Llama 3的推出已经脱离了技术层面的进步，更是开源模型与顶尖闭源模型可分庭抗礼的象征。从Jim Fan分享的基准测试可以看出，Llama 3 400B 的实力几乎媲美 Claude“超大杯”以及新版 GPT-4 Turbo，将成为“分水岭”，相信它将释放巨大的研究潜力，推动整个生态系统的发展，开源社区或将能用上GPT-4级别的模型。此后有消息称，研究人员尚未开始对Llama 3进行微调，还未决定Llama 3是否将是多模态模型；正式版的Llama 3将会在今年7月正式推出。不同于OpenAI等开发商，Meta致力于开源LLM，不过，这个赛道也越来越拥挤。谷歌、特斯拉CEO马斯克旗下的xAI和Mistral 等竞争对手也发布了免费的AI模型。Llama 3问世后，同在4月亮相的4800亿参数模型Arctic击败Llama 3、Mixtra，刷新了全球最大开源模型的纪录。Arctic基于全新的Dense-MoE架构设计，由一个10B的稠密Tranformer模型和128×3.66B的MoE MLP组成，并在3.5万亿个token上进行了训练。相比Llama 3 8B和Llama 2 70B，Arctic所用的训练计算资源不到它们的一半，评估指标却取得了相当的分数。 ... PC版：手机版：

基于 LLaMA 的 AI 聊天机器人开源实现

基于 LLaMA 的 AI 聊天机器人开源实现 Meta 的大语言模型 LLaMA 最近引起了广泛关注，它的一大优势是参数规模更小但性能强于 OpenAI 的 GPT-3 模型，而且能运行在单张显卡上，让普通消费者的硬件也有可能提供类似 ChatGPT 性能的 AI 聊天机器人。LLaMA 是一组大语言模型的集合，其参数规模从 70 亿到 650 亿，它最新的 LLaMA-13B 模型有 130 亿个参数，不到 GPT-3 模型 1750 亿个参数的十分之一。现在AI 推出了首个基于人类反馈强化学习的 LLaMA AI 聊天机器人开源实现。来源，前文：来自：雷锋频道：@kejiqu 群组：@kejiquchat 投稿：@kejiqubot

Meta AI 研发能在智能手机上运行的紧凑大模型

Meta AI 研发能在智能手机上运行的紧凑大模型 Meta A 的研究人员正在开发智能手机上运行的紧凑型大模型 MobileLLM。研究人员致力于优化参数规模低于 10 亿的大模型，相比下 OpenAI GPT-4 的参数规模据称超过 1 万亿。研究人员报告利用一系列新技术，MobileLLM 在基准测试任务上的表现比类似规模的模型改进了 2.7%-4.3%，3.5 亿参数规模的 MobileLLM 在某些任务的准确率与 70 亿参数规模的 LLaMA-2 模型相当。这意味着在特定任务上，紧凑型大模型能提供比更大规模大模型相似的能力，同时计算开销更低。 via Solidot

Meta发布全新大型语言模型LLaMA，加入硅谷AI竞赛

Meta发布全新大型语言模型LLaMA，加入硅谷AI竞赛当地时间2月24日，Meta公司发布一款新的人工智能大型语言模型LLaMA，加入微软、谷歌等硅谷公司的竞赛。Meta首席执行官扎克伯格在Instagram表示，LLaMA模型旨在帮助研究人员推进工作，在生成文本、对话、总结书面材料、证明数学定理或预测蛋白质结构等更复杂的任务方面“有很大的前景”。Meta表示，在大多数基准测试中，参数仅为十分之一的LLaMA-13B的性能优于OpenAI推出的GPT3(175B)，也即支持ChatGPT的GPT3.5的前身。来源，来自：雷锋频道：@kejiqu 群组：@kejiquchat 投稿：@kejiqubot

Meta确认其Llama 3开源大语言模型将于下个月推出

Meta确认其Llama 3开源大语言模型将于下个月推出 Meta 公司全球事务总裁尼克-克莱格（Nick Clegg）说："我们希望在下个月内，甚至更短的时间内，开始推出我们新的下一代基础模型套件 Llama 3。"他的描述听起来像是要发布该产品的几个不同迭代或版本。"今年内，我们将发布一系列具有不同功能、不同通用性的模型，很快就会开始发布。"Meta 首席产品官 Chris Cox 补充说，计划用 Llama 3 支持 Meta 的多个产品。一年多前，OpenAI 推出了 ChatGPT，并将人工智能生成式问答变成了日常的主流体验，这让 Meta 和Google等其他大型科技公司措手不及。Meta 公司在人工智能方面基本上采取了非常谨慎的态度，但这并没有得到公众的认可，以前版本的 Llama 被批评为能力过于有限。(Llama 2于 2023 年 7 月公开发布）。第一版 Llama 并未对外发布，但仍在网上泄露）。与前几代产品相比，Llama 3 的功能更强大，不仅能更准确地回答问题，还能回答更广泛的问题，其中可能包括更具争议性的话题。该公司希望这将使产品受到用户的欢迎。"随着时间的推移，我们的目标是让由 Llama 驱动的 Meta AI 成为世界上最有用的助手，"人工智能研究副总裁 Joelle Pineau 说。"要达到这个目标，还有相当多的工作要做。"该公司没有谈及《Llama 3》中使用的参数的大小，也没有提供它将如何工作的任何演示。预计它将拥有约 1400 亿个参数，而最大的 Llama 2 型号只有 700 亿个参数。最值得注意的是，Meta 的 Llama 系列是作为开源产品构建的，代表了一种不同的哲学方法，即人工智能作为一种更广泛的技术应如何发展。与专有模式相比，Meta 希望通过这种方式获得更多开发者的青睐。但 Meta 似乎也在谨慎行事，尤其是在文本生成之外的其他生成式人工智能方面。皮诺说，公司尚未发布图像生成工具 Emu。考克斯说："延迟、安全性和易用性都非常重要，只有这样才能生成令你自豪的图像，并代表你的创意背景。"具有讽刺意味的是，或者可以说是意料之中的，即使在 Meta 公司努力推出 Llama 3 的同时，公司内部也有一些对生成式人工智能持怀疑态度的重要人士。兼任 Meta 首席人工智能科学家的著名人工智能学者 Yann LeCun 对生成式人工智能的整体局限性进行了抨击，并表示他将赌注押在生成式人工智能之后。他预测这将是联合嵌入式预测架构（JEPA），这是一种训练模型和产生结果的不同方法，Meta 公司一直在使用这种方法在图像生成领域构建更准确的预测性人工智能。"人工智能的未来是 JEPA。它不是生成式人工智能，"他说。"我们得给克里斯的产品部门改个名字"。 ... PC版：手机版：

Meta 公司将发布 LLaMA 的商业版本

Meta 公司将发布 LLaMA 的商业版本 LLaMA 是 Meta 开源的大型语言模型（LLM），于今年 2 月公开发布，并提供给研究人员和学者使用，它有 70 亿、130 亿、330 亿和 650 亿等不同参数规模。开源的 LLaMA 中并没有包括其所使用的权重数据，但很快这些权重数据被“意外”泄露，并迅速引爆了一系列基于它的开源创新。尽管开源人工智能模型已经存在，但 Meta 的 LLaMA 商业化仍是重要的一步，因为它比市场上现有的许多开源 LLM 都要大，而且它来自全球最大的科技公司之一。来源，来自：雷锋频道：@kejiqu 群组：@kejiquchat 投稿：@kejiqubot

🔍 发送关键词来寻找群组、频道或视频。

启动SOSO机器人