GPT-4 有 1.8 万亿参数

GPT-4 有 1.8 万亿参数 OpenAI 今年初公布的新一代大模型 GPT-4 的技术细节泄露，它有 1.8 万亿个参数，利用了 16 个混合专家模型（mixture of experts），每个有 1110 亿个参数，每次前向传递路由经过两个专家模型。它有 550 亿个共享注意力参数，使用了包含 13 万亿 tokens 的数据集训练，tokens 不是唯一的，根据迭代次数计算为更多的 tokens。GPT-4 预训练阶段的上下文长度为 8k，32k 版本是对 8k 微调的结果。如果是在云端进行训练，以每 A100 小时 1 美元计算，那么一次的训练成本就高达 6300 万美元。不过今天的训练成本能降至 2150 万美元。来源，来自：雷锋频道：@kejiqu 群组：@kejiquchat 投稿：@kejiqubot

在Telegram中查看

相关推荐

硅谷圈黑客爆料 GPT-4 参数

硅谷圈黑客爆料 GPT-4 参数在AI博客节目 Latent Space 上，George Hotz (iPhone 和 PS3 破解第一人) 爆料 GPT-4 其实只比1750亿参数的 GPT-3 大一些，任何人都能用8倍资金得到它。 GPT-4 是一个8路混合模型，由8个2200亿参数的专家模型组合而成，OpenAI 使用了不同数据训练了同一个模型8次，然后用了一些技巧使它实际做了 16-iter 推理，混合模型是在没有新想法时所会做的。

今天，Yam Peleg 泄漏了 GPT-4 的一些消息。

今天，Yam Peleg 泄漏了 GPT-4 的一些消息。大模型时代结束了？或许对于其他玩家来说，的确如此。据信，GPT-4 将是 GPT-3 的 10x 规模，拥有 1.8T 参数，120 层。他们采用了混合 MoE 模型，16 experts，每个 111B 参数。训练规模是 13T token，文本内容 2 epochs，代类则是 4. 预训练时采用的是 8K 语境（seqlen），精调后能达到 32K。 Batch Size 达到 6000 万。采用了 8 路 tensor parallelism（NVLink 限制），总之把 A100 券用了。预计是 25000 A100，训练了 90-100 天，MFU 预计 32-36%，2.15e25FLOPS 预计价格是 6300 万美元。

通义千问GPT-4级主力模型降价97%，1块钱200万tokens

通义千问GPT-4级主力模型降价97%，1块钱200万tokens 5月21日，阿里云宣布通义千问GPT-4级主力模型Qwen-Long，API输入价格从0.02元/千tokens降至0.0005元/千tokens，直降97%。这意味着，1块钱可以买200万tokens。这款模型最高支持1千万tokens长文本输入，降价后约为GPT-4价格的1/400。（全天候科技）标签: #阿里云 #通义千问频道: @GodlyNews1 投稿: @GodlyNewsBot

OpenAI新GPT-4 Turbo模型已可使用四项能力提升

OpenAI新GPT-4 Turbo模型已可使用四项能力提升不过更强大的能力同时也意味着更长的响应时间与更高的成本，对于预算有限的项目来说，这也是一个重要的考虑因素。据悉，OpenAI在4月10日正式发布了GPT-4 Turbo，用户可以根据需求构建自己的GPT。GPT-4 Turbo和GPT-4的主要区别在于几个方面：上下文窗口：GPT-4 Turbo拥有更大的上下文窗口，可以处理高达128K个token，而GPT-4的上下文窗口较小。模型大小：GPT-4 Turbo的模型大小为100B参数，这意味着它可以处理更多信息，生成更复杂和细腻的输出，而GPT-4的模型大小为10B参数。知识截止日期：GPT-4 Turbo的训练数据包含到2023年4月的信息，而GPT-4的数据截止于2021年9月，后来扩展到2022年1月。成本：对于开发者来说，GPT-4 Turbo的使用成本更低，因为它的运行成本对OpenAI来说更低。功能集：GPT-4 Turbo提供了一些新功能，如JSON模式、可复现输出、并行函数调用等。总的来说，GPT-4 Turbo的更新更重要的是完善了功能，增加了速度，准确性是否提高仍然存疑。这或许与整个大模型业界目前的潮流一致：重视优化，面向应用。而有可能再次颠覆AI领域的GPT-5，预计将在夏季推出。 ... PC版：手机版：

GPT4模型与GPT4-Turbo模型的区别

GPT4模型与GPT4-Turbo模型的区别 GPT-4和GPT-4 Turbo都是由OpenAI开发的自然语言处理模型。 1⃣ 大小和参数：GPT-4是一个更大的模型，拥有1.75万亿个参数，而GPT-4 Turbo是一个更小的模型，参数数量较少。这意味着GPT-4在处理更复杂的任务和生成更长的文本时可能会更出色，而GPT-4 Turbo则更适合于快速响应和简短的文本生成。 2⃣ 速度和效率：由于GPT-4 Turbo的参数数量较少，它在处理任务时通常会更快，更高效。这使得GPT-4 Turbo更适合于实时应用和对响应时间要求较高的场景。 3⃣ 适用场景：GPT-4适用于更广泛的应用场景，包括但不限于自然语言生成、问答系统、对话系统、摘要生成等。而GPT-4 Turbo更适合于一些简单的任务，如快速回答问题、提供简短的建议或摘要等。 4⃣ 成本：由于GPT-4的计算资源需求更高，因此其使用成本通常会更高。而GPT-4 Turbo由于其更小的模型和更高的效率，其使用成本通常会更低。

DeepSeek Coder 成为第一个打败 GPT-4 Turbo 的开源代码模型

DeepSeek Coder 成为第一个打败 GPT-4 Turbo 的开源代码模型中国 AI 创业公司 DeepSeek 的成为第一个打败 GPT-4 Turbo 的开源代码模型。DeepSeek 上个月发布了混合专家模型，它的代码模型 DeepSeek Coder V2 就是基于该模型，它支持逾 300 种编程语言，在编程任务中超过了最先进的闭源模型如 GPT-4 Turbo、Claude 3 Opus 和 Gemini 1.5 Pro。在 MBPP+、HumanEval 和 Aider 编程测试中，DeepSeek Coder V2 获得了 76.2、90.2 和 73.7 分；在 MATH 和 GSM8K 等数学测试中，DeepSeek Coder V2 表现也类似。DeepSeek Coder V2 采用了 MIT 许可证，对商业使用不设限制，它有 160 亿和 2360 亿参数两个版本。来源，频道：@kejiqu 群组：@kejiquchat

🔍 发送关键词来寻找群组、频道或视频。

启动SOSO机器人