新闻中心back

2026年,具身智能正站在从“炫技”到“干活”的关键转折点上。在刚刚落幕的2026世界人工智能大会上,机器人跳舞的少了,干活的多了——真实产线被搬到了展台。
支撑这一转变的,是一个正被推上风口浪尖的概念——世界模型。
图片

VLA的瓶颈:背熟说明书,却做不稳动作

当前具身大脑的主流方案VLA(视觉-语言-动作模型),多以大语言模型为基座。但随着高质量文本数据增速放缓,VLA的能力边界正逐渐清晰。
北京智源人工智能研究院院长王仲远指出:“真实世界本质是多模态的,图像、视频、音频等信息总量远多于纯文本”。更关键的是,VLA模型缺乏对重力、碰撞等物理规律的前置认知。极佳视界首席科学家朱政打了个比方——就像一个人背熟了操作说明书,真上手时却对不准、做不稳。
机器人更换环境或任务,就需重新采集数据调整,泛化能力严重不足。

世界模型:在“脑海”中预演物理世界

世界模型的核心价值,是在机器人内部构建对世界运行规律的认知体系。北京大学教授黄铁军形容,这类似人脑中映射真实世界的“小宇宙”。
其本质区别在于:大语言模型是“预测下一个词”,世界模型是 “预测下一个物理状态” 。机器人在行动前,先在内部推演后果、模拟变化,再做出最优决策。
具体能力突破体现在三个维度:
破解“物理幻觉”。 世界模型以“预测下一个物理状态”为核心,追求物理一致性、动作因果性,让模型真正掌握重力、碰撞等基础物理常识。
补齐动态过程建模。 自变量机器人CTO王昊认为,世界模型可将“拿起杯子”这类完整语义动作作为最小单元,让视觉、语言、动作在同一尺度下对齐。
实现闭环预演。 从“开环执行”升级为“决策预演”,大幅提升可靠性。星源智联合创始人孙振国介绍,其团队研发的ω-EVA世界模型拥有“动作草稿-后果预演-动作修正”的完整决策路径。
值得强调的是,VLA与世界模型并非替代关系,而是“接力与融合” 。黄铁军认为,在任务明确的工业场景,VLA仍具商业化价值;世界模型则负责理解和预测环境,作为VLA的“感知增强模块”。

从实验室到家庭,还有多远?

尽管前景广阔,世界模型规模化落地仍面临多重挑战。
首先是数据瓶颈。 真实物理世界数据采集成本极高——带本体遥操数据每小时数百元,且失败场景、极端风险数据极度稀缺。觅蜂科技董事长姚卯青坦言,具身智能所需的物理世界数据,信息密度远低于语言,目前还差了万倍以上。
其次是路线分歧。 行业尚未形成统一定义。斯坦福李飞飞教授从功能角度将其分为渲染器、模拟器、规划器三类;智源研究院则从技术路径归纳为语言中心、像素中心、三维结构中心、视觉表征中心四类。
再者是落地尚远。 腾讯混元3D负责人郭春超表示,目前仅在高容错的数字场景(如游戏原型、交互式短视频)实现初步应用;在家庭等对物理精度要求高的场景,仍处于实验室演示阶段。
不过,产业资本已率先用脚投票。2026年上半年,世界模型赛道融资事件达42起,几乎追平2025年全年。智源研究院发布全球首个通用世界基座模型“悟界·Physis-v0.1”;大晓机器人在WAIC发布“开悟世界模型3.1”,直接瞄准零售、酒店等真实场景。

黄铁军认为,虽然家庭等高度非结构化场景的落地仍需较长周期,但世界模型可能是人工智能从数字世界迈向物理世界的解决方案之一,或将决定具身智能真正理解真实环境的能力。
正如2026世界人工智能大会上行业形成的共识:当VLA与世界模型不再是二选一的对立,当仿真数据与真实数据不再是非此即彼的取舍,具身智能的智能涌现或许将从理论预测走向产业现实 。
从“预测下一个词”到“预测下一个物理状态”,人工智能正站在这场范式跃迁的门槛上。世界模型能否成为具身智能真正的“最强大脑”?答案或许就在不远的未来。


Copyright 2015-2023
山西扶摇而上商业管理集团有限公司        版权所有
晋ICP备15006409号     晋公网安备14019202000635号