据彭博社报道,字节跳动正准备推出一款面向实时空间视频生成的AI模型,在机器人和自主系统应用领域与Meta、Google母公司Alphabet展开竞争。据知情人士透露,字节跳动创始人张一鸣正在亲自监督这款新模型的开发工作,该模型最快将于下个月发布。知情人士称,张一鸣一直在协调公司旗下各业务部门的相关工作,并为这一项目调配AI资源和算力。该模型的发布时间尚不确定,计划可能会有所变动。

字节跳动
知情人士称,该模型基于字节跳动现有电影级视频生成AI模型Seedance构建,将允许用户为直播、短剧和游戏创建可交互的虚拟世界。
张一鸣希望这款最新的AI模型,能够让公司凭借在视频领域的顶尖专业能力,进入迅速发展的世界模型领域。他将与李飞飞和杨立昆(Yann LeCun)等人一道,探索AI的视觉化路径,这一方向被认为对机器人技术、游戏和自动驾驶汽车至关重要。
字节跳动的最新模型旨在生成能够对Pico头显用户的语音或动作做出响应的虚拟世界。一名知情人士透露,该模型能够以每秒20帧的速率生成按需视频,延迟约为0.05秒,并可服务于空间计算环境和交互界面。
这款中国模型旨在通过将生成空间内容这一计算密集型过程转移到云端,降低VR普及所需的前期成本。这样一来,头显所需的处理能力就会降低,从而为价格更低、硬件配置更简单的设备打开一条发展路径。快速的内容生成还可能有助于将争夺用户的战场从硬件规格转向AI模型、计算基础设施和内容分发平台。
如果成功,这款新模型可能会为字节跳动与Meta、苹果的竞争开辟一个新的战场。Meta和苹果都在虚拟现实和混合现实设备上投入了巨资。Meta一直试图围绕Quest头显打造面向大众市场的生态系统,而苹果则将Vision Pro定位为高端空间计算平台。但两家公司都未能让这类产品真正走向主流市场。
截至发稿,字节跳动发言人尚未就此置评。

