东吴证券:从LLM到VLA 物理AI成新方向

(原标题:东吴证券:从LLM到VLA 物理AI成新方向)

智通财经APP获悉,东吴证券发布研报称,LLM、VLM、VLA可理解为同一技术脉络上逐层扩展模态和输出能力的三类大模型,从文本到视觉再到动作,能力边界与训练难度逐级抬升。该行认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但难以实现物理世界的建模闭环;物理AI将成为物理世界的AI解决方案,增量空间更大,智能驾驶作为最先跑通闭环的代表场景应重点关注。

东吴证券主要观点如下:

LLM、VLM、VLA是同一技术脉络上逐层扩展模态和输出能力的三类大模型

LLM以文本为输入输出,主要解决语言理解、生成和推理;VLM在语言底座上加入视觉理解,使图像和文字在同一语义空间交互;VLA进一步把动作作为输出模态,使模型能够驱动机器人或车辆在物理世界中行动。三者存在继承关系,但不能简单归结为同一种next token机制。

概念脉络:三类模型各有奠基性技术与路径

LLM由Transformer、GPT等奠定,核心是以海量文本和自监督训练形成语言基础模型;VLM由CLIP、Flamingo等推动,通过图文对齐、视觉编码器和模态投影把视觉信息接入语言模型;VLA由Google DeepMind在RT-2中明确命名,核心是把视觉、语言与动作统一到策略模型中。

数据与表征:三者难度逐级抬升

LLM训练依赖文本语料,VLM增加图文对和视觉编码,VLA则需要机器人示教、遥操作轨迹、动作反馈和真实环境数据。动作不是普通输入模态,而是会改变物理世界的控制输出;因此VLA既可把动作离散化为token自回归生成,也可用扩散策略或流匹配生成连续动作轨迹。

应用边界:从软件任务走向具身执行

LLM主要处理知识、代码、对话和软件任务;VLM把能力扩展到图像理解、图文问答、视觉检索和多模态交互;VLA则进入机器人、自动驾驶和具身执行,需要处理实时性、安全性和物理反馈。NVIDIA的慢思考VLM加快思考动作模型、π0的连续动作生成、RT-2的动作token化,均体现VLA内部路线仍在分化。

产业映射:海外主导基础模型,国内加速跟进,竞争核心向数据、硬件与场景闭环延伸

海外OpenAI、Google、Meta、Anthropic等主导LLM/VLM,Google、Physical Intelligence、NVIDIA、Figure等布局VLA和机器人;国内DeepSeek、阿里、字节、百度、腾讯、智谱、月之暗面、MiniMax等布局LLM/VLM,智元、银河通用等聚焦VLA与机器人本体。后续竞争核心将从模型能力延伸到数据、硬件、动作控制与场景闭环。

物理AI是增量更大的方向,智能驾驶应重点关注

该行认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但难以实现物理世界的建模闭环;物理AI将成为物理世界的AI解决方案,从而在AI当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,应重点关注。

风险提示

技术迭代不及预期风险;大模型厂商ARR增速放缓风险;云服务商资本开支不及预期风险;智能驾驶及机器人商业化落地不及预期风险。

APP下载
广告
相关股票:
好投资评级:
好价格评级:
证券之星估值分析提示智谱行业内竞争力的护城河优秀,盈利能力一般,营收成长性较差,综合基本面各维度看,估值偏高。 更多>>
下载证券之星
郑重声明:以上内容与证券之星立场无关。证券之星发布此内容的目的在于传播更多信息,证券之星对其观点、判断保持中立,不保证该内容(包括但不限于文字、数据及图表)全部或者部分内容的准确性、真实性、完整性、有效性、及时性、原创性等。相关内容不对各位读者构成任何投资建议,据此操作,风险自担。股市有风险,投资需谨慎。如对该内容存在异议,或发现违法及不良信息,请发送邮件至jubao@stockstar.com,我们将安排核实处理。如该文标记为算法生成,算法公示请见 网信算备310104345710301240019号。
网站导航 | 公司简介 | 法律声明 | 诚聘英才 | 征稿启事 | 联系我们 | 广告服务 | 举报专区
欢迎访问证券之星!请点此与我们联系 版权所有: Copyright © 1996-