重磅！美国OpenAI发布首个视频生成模型

重磅！美国OpenAI发布首个视频生成模型 2月16日，OpenAI在其官网发布文生视频模型Sora。据介绍，该模型可以生成长达一分钟的视频，同时保持视觉标准并遵循用户提示。该公司表示Sora能够生成复杂的场景，不仅包括多个角色，还有特定的动作类型，以及针对对象和背景的准确细节主题。除此之外，Sora还可以将静态图像制作成动画。 PS:我有个想法

在Telegram中查看

相关推荐

【马斯克评OpenAI首个视频生成模型：人类认赌服输】

【马斯克评OpenAI首个视频生成模型：人类认赌服输】 OpenAI周四发布了首个视频生成模型Sora，并展示了几段效果炸裂的演示视频。一位X用户分享了Sora生成的一名女子在东京街头漫步的视频，并评论称：“OpenAI今天宣布了Sora，它使用混合扩散和变压器模型架构生成长达1分钟的视频。他们似乎又领先了其他所有人1-2年。以下是我看过的最令人印象深刻的视频，以及生成它们的提示。”另一位X用户评论称：“gg皮克斯。”马斯克回应称：“gg人类（gg humans）。”gg是网络游戏用语“good games”的缩写，主要用于游戏结束后，输赢双方都可以用。快讯/广告联系 @xingkong888885

OpenAI首个视频生成模型发布能生成长达1分钟的高清

OpenAI首个视频生成模型发布能生成长达1分钟的高清视频 AI想象中的龙年春节，红旗招展人山人海。有紧跟舞龙队伍抬头好奇官网的儿童，还有不少人掏出手机边跟边拍，海量人物角色各有各的行为。雨后东京街头，潮湿地面反射霓虹灯光影效果堪比RTX ON。行驶中的列车窗外偶遇遮挡，车内人物倒影短暂出现非常惊艳。也可以来一段好莱坞大片质感的电影预告片：竖屏超近景视角下，这只蜥蜴细节拉满：网友直呼game over，工作要丢了：甚至有人已经开始“悼念”一整个行业：AI理解运动中的物理世界OpenAI表示，正在教AI理解和模拟运动中的物理世界，目标是训练模型来帮助人们解决需要现实世界交互的问题根据文本提示生成视频，仅仅是整个计划其中的一步。目前Sora已经能生成具有多个角色、包含特定运动的复杂场景，不仅能理解用户在提示中提出的要求，还了解这些物体在物理世界中的存在方式。比如一大群纸飞机在树林中飞过，Sora知道碰撞后会发生什么，并表现其中的光影变化。一群纸飞机在茂密的丛林中翩翩起舞，在树林中穿梭，就像候鸟一样。Sora还可以在单个视频中创建多个镜头，并依靠对语言的深入理解准确地解释提示词，保留角色和视觉风格。美丽、白雪皑皑的东京熙熙攘攘。镜头穿过熙熙攘攘的城市街道，跟随几个人享受美丽的雪天并在附近的摊位购物。绚丽的樱花花瓣随着雪花随风飘扬。对于Sora当前存在的弱点，OpenAI也不避讳，指出它可能难以准确模拟复杂场景的物理原理，并且可能无法理解因果关系。例如“五只灰狼幼崽在一条偏僻的碎石路上互相嬉戏、追逐”，狼的数量会变化，一些凭空出现或消失。该模型还可能混淆提示的空间细节，例如混淆左右，并且可能难以精确描述随着时间推移发生的事件，例如遵循特定的相机轨迹。如提示词“篮球穿过篮筐然后爆炸”中，篮球没有正确被篮筐阻挡。技术方面，目前OpenAI透露的不多，简单介绍如下：Sora是一种扩散模型，从噪声开始，能够一次生成整个视频或扩展视频的长度，关键之处在于一次生成多帧的预测，确保画面主体即使暂时离开视野也能保持不变。与GPT模型类似，Sora使用了Transformer架构，有很强的扩展性。在数据方面，OpenAI将视频和图像表示为patch，类似于GPT中的token。通过这种统一的数据表示方式，可以在比以前更广泛的视觉数据上训练模型，涵盖不同的持续时间、分辨率和纵横比。Sora建立在过去对DALL·E和GPT模型的研究之上。它使用DALL·E 3的重述提示词技术，为视觉训练数据生成高度描述性的标注，因此能够更忠实地遵循用户的文本指令。除了能够仅根据文本指令生成视频之外，该模型还能够获取现有的静态图像并从中生成视频，准确地让图像内容动起来并关注小细节。该模型还可以获取现有视频并对其进行扩展或填充缺失的帧，请参阅技术论文了解更多信息（晚些时候发布）。Sora 是能够理解和模拟现实世界的模型的基础，OpenAI相信这一功能将成为实现AGI的重要里程碑。奥特曼在线接单目前已有一些视觉艺术家、设计师和电影制作人（以及OpenAI员工）获得了Sora访问权限。他们开始不断po出新的作品，奥特曼也开始了在线接单模式。带上你的提示词@sama，就有可能收到生成好的视频回复。 ... PC版：手机版：

快手发布国内首个效果对标Sora的视频生成大模型“可灵”，现已开放邀测

快手发布国内首个效果对标Sora的视频生成大模型“可灵”，现已开放邀测近日，快手“可灵”视频生成大模型官网正式上线。据介绍，可灵大模型为快手AI团队自研，基于快手在视频技术方面的多年积累，采用Sora相似的技术路线，结合多项自研技术创新，效果对标Sora。可灵大模型不仅具备强大的概念组合能力和想象力，还能够生成大幅度的合理运动、模拟物理世界特性。其生成的视频分辨率高达1080p，时长最高可达2分钟（帧率30fps），且支持自由的宽高比。目前，可灵大模型已在快影App开放邀测体验。（36氪）标签: #快手 #Sora #可灵频道: @GodlyNews1 投稿: @GodlyNewsBot

OpenAI的Sora视频生成模型也能用来渲染游戏

OpenAI的Sora视频生成模型也能用来渲染视频游戏这篇题为《作为世界模拟器的视频生成模型》（Video generation models as world simulators）的论文由多位 OpenAI 研究人员共同撰写，揭开了 Sora 架构关键方面的神秘面纱例如，Sora 可以生成任意分辨率和长宽比（最高 1080p）的视频。根据论文所述，Sora 能够执行一系列图像和视频编辑任务，从创建循环视频、向前或向后延伸视频到更改现有视频的背景。但最吸引笔者的还是 Sora"模拟数字世界"的能力，OpenAI 的合著者如是说。在一次实验中，OpenAI 将 Sora 放到 Minecraft 上，让它在控制玩家的同时渲染世界及其动态（包括物理）。Sora 在 Minecraft 中控制一名玩家，并渲染视频游戏世界，请注意，颗粒感是由视频到 GIF 的转换工具造成的，而不是 Sora。图片来源：OpenAIOpenAI那么，Sora 是如何做到这一点的呢？正如 NVIDIA 高级研究员 Jim Fan（通过 Quartz）所说，与其说 Sora 是一个创意引擎，不如说它是一个"数据驱动的物理引擎"。它不仅能生成单张照片或视频，还能确定环境中每个物体的物理特性，并根据这些计算结果渲染照片或视频（或交互式 3D 世界，视情况而定）。合著者写道："这些功能表明，继续扩展视频模型是开发物理和数字世界以及其中的物体、动物和人的高能力模拟器的一条大有可为的途径。"现在，Sora在视频游戏领域也有其通常的局限性。该模型无法准确模拟玻璃碎裂等基本互动的物理过程。即使在可以建模的互动中，Sora 也经常出现不一致的情况，例如在渲染一个人吃汉堡时，却无法渲染汉堡上的咬痕。不过，如果我没看错的话，Sora 似乎可以为更逼真（甚至可能是逼真）的程序生成游戏铺平道路。这既令人兴奋，又令人恐惧（考虑到Deepfake的影响）这也许就是为什么 OpenAI 选择暂时将 Sora 关在一个非常有限的访问程序后面的原因。相关文章:OpenAI 推出文本到视频人工智能模型 SoraOpenAI首个视频生成模型发布能生成长达1分钟的高清视频 ... PC版：手机版：

AI 视频生成 Sora 发布，眼见为实终结

AI 视频生成 Sora 发布，眼见为实终结 OpenAI 再次震撼世界，划时代文本生成视频模型 Sora 正式发布，这是以文本描述生成视频的人工智能模型 Sora 的介绍影片。通过一段文字，Sora 可以创建长达 60 秒的视频，其中包含高度详细的场景、复杂的摄像机运动以及充满活力的情感的多个角色。由于担心 Sora 可能被滥用，OpenAI 表示目前没有计划向公众发布该模型，而是给予小部分研究人员有限的访问权限，以理解模型的潜在危害。 From OpenAI via 开眼精选 (author: 开眼科技精选) Invalid media: video

商汤发布首个 “可控” 人物视频生成大模型 Vimi

商汤发布首个 “可控” 人物视频生成大模型 Vimi 据界面新闻，商汤发布首个 “可控” 人物视频生成大模型 Vimi，该模型主要面向 C 端用户，支持聊天、唱歌、舞动等多种娱乐互动场景。商汤方面称，Vimi 可生成长达 1 分钟的单镜头人物类视频，画面效果不会随着时间的变化而劣化或失真，Vimi 基于商汤日日新大模型，通过一张任意风格的照片就能生成和目标动作一致的人物类视频，可通过已有人物视频、动画、声音、文字等多种元素进行驱动。

🔍 发送关键词来寻找群组、频道或视频。

启动SOSO机器人