据彭博报道,字节跳动正在开发一款面向实时空间视频生成的世界模型(World Model),最快可能在下个月推出。知情人士称,张一鸣本人正在协调公司不同业务线,并为项目调配AI人才、算力等资源,不过发布时间仍可能变化。
这款模型建立在字节现有视频生成模型Seedance之上。
它和普通文生视频最大的区别是:生成出来的不再只是一段固定视频,而是一个可以实时交互的虚拟世界。
比如用户戴着Pico头显进入一个AI生成的空间后,里面的环境可以根据人的声音和动作实时发生变化。应用场景包括直播、短剧、游戏,以及未来的机器人和自动驾驶训练。
按照知情人士透露的数据,这套模型目前能够以约0.05秒延迟、20帧/秒生成视频内容。
这也意味着,字节正在进入目前AI最热门的方向之一:世界模型。
世界模型的目标,是让AI不只是理解文字和图片,还能理解物体如何运动、空间如何变化,以及人的行为会对环境产生什么影响。
Google今年已经推出Genie,可以让用户实时进入AI生成的虚拟世界;李飞飞创办的World Labs、Yann LeCun等人,也都在押注这一方向。
字节的优势则来自视频。Seedance已经成为字节目前最成功的AI模型之一,被用于剪映海外版CapCut、豆包等产品,也被不少独立影视工作室、创作者和AI创业公司采用。
字节希望把这套能力进一步连接起来:Seedance负责生成内容,云计算提供算力,TikTok和其他内容平台负责分发,Pico则提供硬件入口。
其中一个关键变化,是把大量计算放到云端。传统VR设备为了运行复杂的3D内容,需要更强的芯片,也意味着更重、更贵的头显。如果AI能够在云端实时生成空间内容,头显本身需要的计算能力就可以下降。
理论上,这可能让Pico等设备做得更便宜。竞争的重点也会随之变化:过去VR公司比的是屏幕、芯片和光学参数,未来可能更多比谁的AI模型更强、算力更多、内容生成得更快。这也让字节与Meta、Apple之间出现新的竞争线。
字节如果能把AI生成内容和更便宜的硬件结合起来,可能会尝试走另一条路线。背后则是越来越激进的AI投入。彭博此前报道称,字节今年考虑将AI相关资本开支提高到最高700亿美元;公司上周还获得了一笔300亿美元贷款,部分资金将用于数据中心和AI基础设施建设。