首页 - 股票 - 证券之星 - 热点追踪 - 正文

从“猜画面”到“建空间”:Atlas让世界模型走出实验室

来源:证券之星财经 2026-09-03 16:00:46

当地时间2026年9月1日(北京时间9月2日),World Labs发布了一款名为Atlas的模型。团队官方的定义是“全球首个多模态世界模型”,但实际演示中它做的事情可以概括得很朴素:给它几张普通照片,设定好镜头轨迹,它就能生成长达一分钟、1440p分辨率的高清视频,镜头角度和运动路线完全由你控制。输入一张只拍到正面的机器人照片,它能补全人背后的场景——墙壁、窗户、桌角,仿佛那个空间本来就存在。

技术圈很快把它和Sora放在一起比较。但Atlas值得被单独讨论,不是因为它生成视频的长度或清晰度又刷新了纪录,而在于它选择了另一条路——不再满足于“生成好看的画面”,而是试图让AI真正理解三维空间长什么样、物体之间的位置关系如何、镜头转过去之后应该看到什么。

这个转变,指向的是一年以来被反复讨论、却迟迟没有落地的概念:世界模型。

一条被挤爆的赛道和一个被低估的方向

过去一年,AI视频生成几乎是整个行业最拥挤的赛道。从科技巨头到创业公司,每隔几周就有一个新模型发布,你追我赶地刷新分辨率、时长和画面真实感。但无论画面多精致,这些模型本质上做的还是同一件事:把文字提示转换成看起来合理的二维像素排列。

它们不知道画面里的椅子在三维空间中应该多大、桌子在椅子前面还是后面、镜头转到背后会不会露出一片空白。因为训练数据本身是二维的图片和视频,模型学到的只是“什么颜色的像素块通常挨着什么颜色的像素块”。画面可以很逼真,但空间是错的——镜头一拉,桌子跟着转,墙上的画莫名其妙飘在半空。

Atlas试图回答一个更根本的问题:AI能不能不要只猜像素,而是先理解空间再生成画面?它的做法是,把每一张输入图片都锚定在三维空间中的精确位置,附带相机位姿和深度信息。这相当于给了模型一个带坐标轴的三维草稿本。在此基础上,它以多模态自回归扩散Transformer为底座,原生处理文本、图像、视频与3D四类数据——相机位姿与深度信息即属于后者。

效果上最直观的差异体现在“镜头控制”。用传统视频模型,你想让镜头左移、环绕或升降,只能在提示词里写电影术语,然后祈祷模型理解你的意思。Atlas直接把“相机位姿参数”做成原生输入,你要什么角度、什么轨迹、走多快,直接给坐标。World Labs管这叫“坐进导演椅,而不是在拉老虎机的拉杆”。

这个区别看似技术细节,实际上划出了一条分界线:一边是像素级生成器,一边是空间级理解者。

影视行业的门槛正在松动

Atlas带来的连锁反应,首先会冲击影视制作领域。

传统三维重建是个苦差事。要还原一个真实场景的3D模型,需要扛着激光雷达或深度摄影机围着目标转几十圈,拍几百上千张照片,再花大量算力和人力做后期拼接。在官方演示中,Atlas用2到25张地面随手拍摄的普通照片,就重建了斯坦福大学主方庭等大型场景。在DTU、ETH3D等7个公开数据集上的测试中,它的平均稀疏视角重建误差为25.3‰,优于多个专门做3D重建的模型。

对影视工作者来说,这意味着用几张照片就可以还原一个空间场景。传统拍“子弹时间”特效需要几十上百台相机同时触发,Atlas用普通手机视频就能做到——时间冻结,镜头环绕,周围环境由模型实时补全。影视预演、虚拟制片、特效制作,这些原本需要大量预算和专业设备的环节,门槛正在被拉低。

当然,Atlas目前生成的是一个“视觉上合理”的三维世界,未必是原来那个世界的精确数字复刻。但对影视创作而言,镜头没拍到的地方,AI补出一扇门、一面墙、一条走廊,视觉上连贯就足够用了。

值得注意的是,World Labs并没有把Atlas定位成一个面向消费者的产品。它目前仅向少数合作伙伴开放早期访问,公开结果主要来自官方演示。这家公司更想做的,是给专业创作者和开发者提供一套能理解空间、可交互的底层工具。

机器人的新训练场

比影视行业更值得期待的应用,在机器人领域。

训练机器人需要海量数据。一个机械臂要熟练抓取不同形状、材质、摆放角度的物体,需要见过成千上万种场景。但真实世界的数据采集成本极高——你得布置场景、安装传感器、反复运行、记录数据。传统做法是用专业设备扫描真实环境建立数字模型,费钱又费时间。

Atlas提供了一种新思路。World Labs的演示中,团队用两段手机视频分别重建了两处大型空间,每段只取了24帧,然后让不同机器人沿不同路线在其中移动,生成机器人传感器会观测到的RGB图像和深度数据。一次实拍,就能变出一批不同的训练和测试环境。

李飞飞的学生、英伟达杰出科学家和机器人主管Jim Fan评价说,这是机器人领域Real-to-Sim的一大步。所谓Real-to-Sim,就是用现实拍摄的画面构建仿真训练场,机器人在里面反复训练后再迁移回现实世界。这解决了机器人训练中一个长期存在的痛点:真实数据匮乏。以前训练机械臂抓杯子,得在仿真器里手动搭几百个厨房场景,现在几张照片就能生成一个逼真的三维模拟环境。

不过,Atlas目前还不是万能的。它擅长构建几何连贯的静态空间,官方演示也展示了刚体、铰接体等物体的交互模拟,但这些能力目前均出自World Labs自己,通用物理模拟的精度与可靠性,还要等外部团队的独立实测。对机器人训练来说,台阶高度、障碍物位置和物体运动一旦猜错,错误也会跟着进入训练数据,最后由真机来买单。Atlas究竟能省下多少成本、能产出多少有效训练数据,同样有待验证。

世界模型有了一个看得见摸得着的样本

Atlas的发布,是李飞飞长期理论的一次落地。

早在2024年创办World Labs时,李飞飞就提出一个判断:如果AI没有空间智能,就不可能真正实现AGI。大语言模型让机器学会了遣词造句和逻辑推理,但物理世界运行的底层逻辑完全不同——语言模型学的是文本的统计规律,世界模型学的是时空的统计规律。

2026年6月,李飞飞发表了一篇长文《世界模型的功能分类法》,把世界模型分为三大类:渲染器输出画面、回答“看起来像什么”,模拟器输出可计算的世界状态——几何、物理和动力学,规划器回答“下一步该做什么”。Atlas的定位,正是从“渲染器”向“模拟器”跨越的一步。它不满足于生成好看的画面,而是试图维护一个可测量、可交互的三维空间状态。

这个定位得到了资本市场的认可。World Labs成立于2024年,当年以约2.3亿美元融资走出隐身模式;2026年2月又完成10亿美元新一轮融资,Autodesk领投2亿美元,英伟达、AMD、a16z、富达等跟投,投后估值据公开报道约50亿美元。

李飞飞在Atlas发布后写道,这是团队的“里程碑式成果”。这个措辞值得玩味——不是“终极方案”,不是“突破天花板”,而是“里程碑”。从ImageNet开启计算机视觉革命,到如今Atlas试图让AI理解三维世界,这条路径一脉相承。大语言模型让AI学会了“说话”,世界模型要做的是让AI学会“看”和“动”。

Atlas只是这条路上的一个重要节点。它证明了用多模态信息构建可交互三维世界是可行的,也暴露了距离真正的物理模拟器还有多远。但当AI真正理解空间、时间和物理法则之后会变成什么,现在还远远看不到边界。至少,我们已经看到它迈出了第一步。

APP下载
广告
下载证券之星
郑重声明:以上内容与证券之星立场无关。证券之星发布此内容的目的在于传播更多信息,证券之星对其观点、判断保持中立,不保证该内容(包括但不限于文字、数据及图表)全部或者部分内容的准确性、真实性、完整性、有效性、及时性、原创性等。相关内容不对各位读者构成任何投资建议,据此操作,风险自担。股市有风险,投资需谨慎。如对该内容存在异议,或发现违法及不良信息,请发送邮件至jubao@stockstar.com,我们将安排核实处理。如该文标记为算法生成,算法公示请见 网信算备310104345710301240019号。
网站导航 | 公司简介 | 法律声明 | 诚聘英才 | 征稿启事 | 联系我们 | 广告服务 | 举报专区
欢迎访问证券之星!请点此与我们联系 版权所有: Copyright © 1996-