近日，谷歌的人工智能模型 Gemini 1.5 对 OpenAI Sora 生成的一段视频进行了评价，称其在视觉上很吸引人，但一

近日，谷歌的人工智能模型 Gemini 1.5 对 OpenAI Sora 生成的一段视频进行了评价，称其在视觉上很吸引人，但一些不合理之处可以看出其不是真实的视频。双方分别发布了各自的最新技术：谷歌推出 Gemini 1.5 Pro，OpenAI 则推出了文本转视频工具 Sora。Sora 的发布时机引发猜测，有人认为 OpenAI 是为了转移公众对谷歌 Gemini 1.5 的注意力。谷歌一位高管在 X 平台上分享了对 Sora 生成视频的详细分析，Gemini 1.5 Pro 以 Sora 生成的日本一条既有雪景又有樱花盛开的街道视频为例，指出视频存在明显不合理之处。根据 Gemini 1.5 Pro 的分析，大雪纷飞和盛开的樱花同时出现并不符合常理，因为樱花通常在春季开放，不会伴有降雪。而且雪的下落方式非常均匀，这不是现实生活中通常的降雪方式。此外，视频中的人物虽然身处大雪环境，却并未穿着任何冬装，这也显得非常违和。 Gemini 1.5 在分析中总结道：“总而言之，这段视频虽然视觉上很吸引人，但其中的矛盾之处表明它并非现实生活中的场景。” Sora 是一款能够生成长达 60 秒视频的文本转视频工具，可以创建包含细节丰富的场景、复杂摄像机运动以及具有丰富情感的多个人物画面，许多人将其称为视频生成领域的 “ChatGPT 时刻”。而谷歌的 Gemini 1.5 则拥有惊人的 100 万词条上下文窗口，远超 GPT-4 Turbo 的 12.8 万和 Anthropic Claude 2.1 的 20 万。这意味着它可以一次处理大量信息，包括 1 小时的视频、11 小时的音频以及超过 30,000 行代码或 70 万字的代码库。 via 匿名标签: #Google #OpenAI 频道: @GodlyNews1 投稿: @GodlyNewsBot

在Telegram中查看

相关推荐

Google Gemini 1.5 Pro 评价 OpenAI 最新 Sora 视频

Google Gemini 1.5 Pro 评价 OpenAI 最新 Sora 视频让 Google Gemini 1.5 Pro 判断 OpenAI 在 TikTok 发布的最新 Sora 视频是否是 AI 生成的，有什么不合理的地方，它表示，这段视频是由人工智能生成的。视频中的蜜蜂飞得太快，而且不稳定，似乎能够瞬间改变方向。此外，蜜蜂的翅膀拍打方式也不真实。 TikTok 视频链接： via 匿名标签: #Google #Gemini 频道: @GodlyNews1 投稿: @GodlyNewsBot

谷歌宣布推出 Gemini 1.5 闪电模型等

谷歌宣布推出 Gemini 1.5 闪电模型等当地时间5月14日，谷歌 DeepMind 首席执行官宣布推出 Gemini 1.5 闪电模型，该模型能够兼顾快速和成本效益。该公司还展示了 Astra 模型，该模型通过智能手机摄像头分析世界，并与用户进行对话。该公司将推出人工智能视频生成模型 Veo，对标 OpenAI 的文生视频模型 Sora。谷歌发布第六代 TPU 芯片 Trillium。谷歌宣布推出 Imagen 文生图模型，相较于其他同类产品具备更高的细节调整功能，逼真的光线和更少的干扰，能够从草图快速升成高分辨率图像。安卓15已融入谷歌 Gemini 大模型升级后能力，Android 15 Beta 2 将在当地时间5月15日正式推出。谷歌宣布推出全新音乐工具 Music AI Sandbox。财联社、、、、、

OpenAI的首席技术官Mira Murati在接受华尔街日报采访时对Sora的进行了详细介绍。|

OpenAI的首席技术官Mira Murati在接受华尔街日报采访时对Sora的进行了详细介绍。| 发布时间：Sora目前还在开发和测试阶段，OpenAI计划在今年内的某个时间发布Sora，具体时间可能考虑到全球选举等因素，目前仍在打磨中，且正在进行外部测试，尤其关注电影行业的创作者。生成时间：关于生成视频的时间，720P分辨率或20秒长视频，生成时间大概在几分钟，这取决于提示的复杂性，这与传言中需要数个小时的说法不同，同时他们也在优化资源。目前视频没有声音，Sora未来可能会支持视频声效。数据来源：当被问及Sora训练的素材是否包括YouTube、Instagram和Facebook上的视频时，Mira Murati的回答是不确定的。她没有明确确认这些平台的视频是否被用作训练数据，称Sora的训练数据来自公开可用和授权的数据，最后结束后确认训练数据包括Shutterstock的内容。计算资源：Sora的生成过程相比于ChatGPT和DALI需要更多的计算资源，OpenAI致力于优化技术，降低成本，便于公众使用。安全性和可靠性：Sora目前正在进行红队测试（测试工具的安全性、可靠性和缺陷），以识别潜在的漏洞、偏见和其他有害问题。内容限制：与DALLE类似，Sora在生成内容时也会有一些限制，例如不生成公众人物的图像，以避免误导和滥用。裸露内容：关于裸露内容的处理，提到OpenAI正在与艺术家和创作者合作，以确定工具应该提供的灵活性水平和合理的限制，但没有具体提到如何区分艺术和色情的内容。正在研究对视频进行水印标记，但是相对一水印，视频内容的审核限制更为重要，因为随着生成的视频更加真实，用户将无法分辨视频内容的真实性，防止生成误导内容。

OpenAI的Sora会砸掉谁的饭碗？

OpenAI的Sora会砸掉谁的饭碗？ Google新模式性能完胜周四，Google突然发布了新一代多模态大模型Gemini 1.5 Pro，在与OpenAI的大模型之战中加速超越。这是业界迄今最强的大语言模型，最高可支持10，000K Token上下文，直接将性能提升到了百万级别，在性能上完全秒杀了OpenAI的GPT-4 Turbo。百万级别Token意味着什么？GoogleAI项目负责人杰夫·迪恩（Jeff Dean）解释说，在Gemini 1.5 Pro百万级别上下文窗口支持能力下，用户可以完成复杂的内容交互，轻松解析整本图书、电影、播客，理解非常长的文档，甚至是数百个文件数十万行的代码库。Gemini 1.5 Pro的发布，意味着Google在和OpenAI的军备竞赛中占据了强大的性能优势。相比之下，OpenAI的GPT-4 Turbo只能处理128k Token，而且近期更是出现了性能下滑的不利状况，直到上个月发布更新之后才有所改善。然而，OpenAI并没有让Google独美。就在同一天，他们发布了文本生成视频的AI模型Sora，只需文本就能自动生成视频；继文本模型ChatGPT和图片模型Dall-E之后，OpenAI又开始颠覆视频领域。相比GoogleGemini 1.5 Pro基于数据性能的硬实力优势，Sora基于视觉美学的惊艳表现，显然更容易让人印象深刻，迅速成为了社交网站上的热点。以假乱真细节惊艳Sora到底惊艳在哪里？OpenAI展示了多段Sora制作的视频内容，光是这些片段，就已经足够让人大跌眼镜。OpenAI在官方博客中写道，Sora不仅可以理解用户的需求，还知道这些事物在现实世界如何存在。只需要输入一段文本，Sora就能自动生成最长一分钟的高清视频。令人难以置信的是，Sora不仅可以准确把握用户文本中的复杂意思，并且还能分拆出不同的元素，将其转换为有具体创意构思的视频内容，看起来就像是专业导演、摄像和剪辑的作品。一位戴着墨镜、穿着皮衣的时尚女子走在雨后夜晚的东京市区街道上，抹了鲜艳唇彩的唇角微微翘起，即便带着墨镜也能看到她的微笑，地面的积水映出了她的身影和灯红酒绿的霓虹灯；热闹非凡的唐人街正在进行舞龙表演，熙熙攘攘的人群目光都聚焦在跃动的彩龙身上，整个环境的喜庆氛围仿佛令人身临其境。与此前的AI视频存在明显塑料感不同，此次Sora制作的视频在逼真度和艺术感方面有着显著差别：微微卷曲的人物头发，女人脸上的黑痣粉刺，地面积水倒映的霓虹光影，街头商贩摆卖的诸多食品，天空飘落的樱花细雪，细节的精细度几乎已经做到了以假乱真。更令人惊讶的是，Sora视频在构图、色彩、创意和运镜方面，都呈现出明显的电影风格，无论是一镜到底还是多机位都可以无缝切换，甚至还有“演员”的表情神态，这是此前的文生视频产品所不具备的。OpenAI一出手就将整个AI视频行业提升了一个级别。虽然Sora制作的视频还没有到完美的地步，仔细看还能看出“穿帮”之处，人物吃过的饼干甚至会完好无损，但在影像画质上已经较此前的AI视频有了质的飞跃，甚至有了电影的质感。而且，仅仅根据一段抽象的文字就能制作类电影的多镜头视频，这种语义理解和镜头运用能力更是接近了人类导演、摄像与剪辑的水平。显然，视频领域的ChatGPT时刻已经到来。AI进化速度令人震惊Sora发布之后，网络一片惊叹，几乎抢尽了Gemini的风头。AI的进化速度实在令人震惊。要知道，此时距离OpenAI推出ChatGPT，开启生成式AI时代，仅仅过去了14个月时间。直到去年，我们才刚刚熟悉文本生成图片的产品，而仅仅半年前，MidJourney创作的AI图片里还会出现六指人物。而现在，Sora的视频就已经让所有人开始感受到现实和虚拟的界限模糊。虽然OpenAI的GPT-4 Turbo此前出现了性能下滑和速度变慢的状况，令人担心生成式AI的增长遭遇了瓶颈；但Sora的发布无疑打消了所有人的担忧。云计算公司Box创始人兼CEO列维（Aaron Levie）在Sora发布之后感慨说，“如果有人还担心AI进化速度会变慢的话，我们又一次看到了完全相反的典范。”目前Sora只面向邀请的制作者和安全专家开放测试，发现和解决可能的安全问题，还没有宣布正式的公测时间表。毕竟在虚假信息充斥的互联网，DeepFake的道德问题也已经成为了关注焦点，像Sora这样以假乱真的视频一旦被滥用，可能会引发灾难性后果。在发布Sora的几乎同一时间，OpenAI还完成了一项要约售股交易，并不是融资用于公司用途，而是允许员工向以Thrive Capital牵头的风投机构出售现有股份套现。值得一提的是，作为OpenAI董事会成员，奥特曼自己并不持有公司股票，估值飙升并不能给他带来巨额财富。此次交易对OpenAI的整体估值达到了800亿美元，较之去年年初的300亿美元飙升了两倍多。按照投融资市场调研公司CB Insights统计，OpenAI已经成为全球估值最高的创业公司之一，仅次于字节跳动和SpaceX。实际上，此次交易本应在去年11月完成，只是因为奥特曼与董事会的冲突风波才被迫搁置。随着奥特曼重新回到OpenAI CEO职位，投资者再次给这家AI巨头投出了信任票。显然，在Sora正式发布之后，OpenAI的估值还会进一步飙升。巨头出手碾压AGI同行那么，令人惊艳的文本生视频Sora究竟会带来哪些冲击？AGI视频同行无疑是遭受最直接冲击的。Sora发布之后，AI视频创业公司Runway CEO瓦伦祖拉（Cristóbal Valenzuela）在X平台（此前的Twitter）上简单发布了两个字，“Game On．”（竞争开始了）。几个月前，Runway刚刚发布了Gen-2视频模型。而另一家AI视频公司Stability的CEO莫斯塔克（Emad Mostaque）则直接感慨，“奥特曼真是个魔术师。”Runway创办已有五年时间，在AI视频领域占据着先发优势，已经得到了好莱坞主流片场的使用。去年拿到七项奥斯卡大奖的年度影片《瞬息全宇宙》就使用了Runway来制作AI视频。在《瞬息全宇宙》大获成功之后，Runway新一轮融资估值也水涨船高，达到了15亿美元，是一年之前估值的三倍。文生视频领域是目前最热的创业领域。过去几个月时间，随着生成式AI热潮涌动，也涌现出了不少文本生视频和图片生视频的创业公司。A16z的AI投资合伙人摩尔（Justin Moore）列出了他所跟踪的20多家文生视频创业团队，其中不乏Pika、Zeroscope这样一度引发网络惊叹的创业新贵。去年年底，斯坦福华人毕业生创办的Pika视频一度引发了中美互联网的惊叹。得益于AI视频的惊艳表现，这家仅有四人的创业公司，在不到半年时间就完成了超过5500万美元的三轮融资，估值飙升到了2.5亿美元。但现在，AI巨头OpenAI直接抛出了Sora。无论是视频时长，还是画面精细度，还是细节完整性，或是多镜头拍摄，Sora都远远超越了这些小创业公司的视频，用碾压来形容也并不为过。虽然AI视频领域还有着巨大的提升和增长空间，但这些小公司的未来是否有能力与OpenAI竞争依然是个巨大的疑问。左右好莱坞劳资谈判不过，Sora影响的不仅是其他AGI视频创业公司的生存空间，更会改变整个好莱坞以及电影、电视、广告、游戏行业的未来游戏规则。好莱坞使用AI制作图片和视频，并不是什么新鲜事，从CG（电脑动画）、VR到AI，影视娱乐行业一直是高新技术的最先采用者。然而，与其他技术不同，AI工具始终是扎在好莱坞从业人员心中的一根刺。除了《瞬息全宇宙》使用了Runway的AI视频工具，去年21世纪福克斯已经与IBM沃森合作，用AI工具为关于AI主题的恐怖片《摩根》制作预告片；迪士尼旗下的漫威更完全用AI制作了《秘密入侵》的开头动画。当时正值好莱坞演员和编剧工会大罢工期间。而生成式AI在影视行业的应用也是双方的争议焦点之一。就在双方谈判的过程中，演员编剧们得知迪士尼漫威新一季的... PC版：手机版：

谷歌升级Gemini 1.5 Pro AI可以听音频了

谷歌升级Gemini 1.5 Pro AI可以听音频了 Gemini 1.5 Pro被视为Gemini家族中的“中量级”（middle-weight）模型，其性能已经超越了最大规模、最强大的Gemini Ultra。谷歌表示，Gemini 1.5 Pro能够理解复杂指令，而且使用时无需对模型进行特别调整。需要指出的是，不通过Vertex AI的用户无法体验到Gemini 1.5 Pro的全部功能。目前，大众主要通过Gemini聊天机器人与Gemini大语言模型互动。尽管GeminiUltra为Gemini Advanced聊天机器人提供了强大支持，能理解较长的指令，但在反应速度上不及Gemini 1.5 Pro。除了Gemini 1.5 Pro的更新，谷歌还对其它大型人工智能模型进行了升级。特别是作为文本转图像生成模型的Imagen 2，它增强了Gemini的图像生成能力。通过引入图像外延（Outpainting）和内填（Inpainting）功能，用户现在能更灵活地对图像的元素进行添加或删除。为确保Imagen模型生成的图片版权和来源可追溯，谷歌为所有生成图片加入了SynthID数字水印技术。这种创新技术通过几乎不可见的水印明确标识图片来源，可以通过专用工具进行检测。Imagen模型的许多新特性，如图像外延和内填技术，已被其他文本转图像模型采用，例如Stability AI的Stable Cascade和Getty的Generative AI by iStock。此外，这些技术也被广泛应用于消费电子产品中，如三星Galaxy手机。除图像生成的创新外，谷歌还公开展示了一种结合人工智能生成回答和谷歌搜索结果的方法，旨在为用户提供更实时、更准确的信息。然而，大语言模型生成的回答并非总是精准无误，有时可能会误导用户。因此，谷歌对Gemini模型设置了一些限制，比如禁止回答与2024年美国大选相关的问题。此前，Gemini模型因在生成历史人物描述时出现不准确而受到批评。 ... PC版：手机版：

OpenAI 推出文本到视频人工智能模型 Sora

OpenAI 推出文本到视频人工智能模型 Sora 根据 OpenAI 的介绍博文，Sora 能够创建"具有多个角色、特定运动类型以及主体和背景准确细节的复杂场景"。该公司还指出，该模型能够理解物体"在物理世界中的存在方式"，还能"准确解释道具并生成表达生动情感的引人注目的角色"。该模型还能根据静态图像生成视频，以及在现有视频中填充缺失的帧或扩展视频。OpenAI 的博文中包含的 Sora 生成的演示包括淘金热时期加利福尼亚州的空中场景、从东京火车内部拍摄的视频等。许多演示都有人工智能的痕迹比如在一段博物馆的视频中，地板疑似在移动。OpenAI 表示，该模型"可能难以准确模拟复杂场景的物理现象"，但总体而言，演示结果令人印象深刻。几年前，像 Midjourney 这样的文本到图像生成器在模型将文字转化为图像的能力方面处于领先地位。但最近，视频技术开始飞速进步：Runway 和 Pika 等公司都展示了自己令人印象深刻的文字转视频模型，而Google的 Lumiere 也将成为 OpenAI 在这一领域的主要竞争对手之一。与 Sora 类似，Lumiere 也为用户提供了文字转换视频的工具，还能让用户通过静态图像创建视频。Sora 目前只对"红队"人员开放，他们负责评估模型的潜在危害和风险。OpenAI 还向一些视觉艺术家、设计师和电影制片人提供访问权限，以获得反馈意见。它指出，现有模型可能无法准确模拟复杂场景的物理现象，也可能无法正确解释某些因果关系。本月早些时候，OpenAI 宣布将在其文本到图像工具 DALL-E 3 中添加水印，但指出这些水印"很容易去除"。与其他人工智能产品一样，OpenAI 将不得不面对人工智能逼真视频被误认为是真实视频的后果。 ... PC版：手机版：

🔍 发送关键词来寻找群组、频道或视频。

启动SOSO机器人