正在读取更新

量子位

索辰科技加码世界模型,与战略投资企业美梦空间联合发布具身模型与物理测评标准

作者:量子位的朋友们全文 3,733 字约 8 分钟浏览 — 次

“世界模型”开始成为具身智能跨越商业化“奇点”的新叙事。

当下,具身智能的商业化路线正撞上一堵墙。

北大与BeingBeyond联合发布的BeTTER基准(ECCV 2026)戳破了这层窗户纸:最先进的VLA模型在标准静态测试中表现尚可,一旦引入空间布局偏移或时序外推等干预,成功率断崖式下跌。另一项斯坦福大学研究则直接锁定了病因:在接触丰富任务中,VLA存在“精度失效”与“力失效”两个相互独立的失效模式。

原文配图 1

现有测评关注与被忽略的物理变量

换句话说,VLA驱动下的机器人只知道“看到杯子就该抓”,但不知道“杯壁有多薄、摩擦力够不够、注水后重心会不会偏”。它本质上是个统计学模仿者,不是物理世界的参与者。

当VLA的局限逐渐暴露,“世界模型”开始成为具身智能跨越商业化“奇点”的新叙事。

原文配图 2

9月26日,美梦空间CEO李明昊在第五届全球数字贸易博览会首发首秀主舞台上,首次公开并正式发布Physical-WAM、RoboTwin-Phys两项重要成果

第五届全球数字贸易博览会上,杭州美梦空间科技有限公司(Memo)给具身智能补上了这堂“物理课”。教具是两份:全球首个具备物理感知能力的Physical-WAM物理-世界动作模型,以及业内首个RoboTwin-Phys物理漂移评测基准——一个负责让机器人“懂物理”,具备人类式的预判能力,一个验证它是否真的“懂了”。

美梦空间专注于世界模型的研发与应用,由北京大学信息技术高等研究院高文院士领衔的AVS先进视觉系统研究中心孵化,核心团队在具身智能、视频编解码、空间计算、人工智能领域积累了深厚的研究经验,兼具学术深度与工程落地能力。2026年8月,物理AI头部企业索辰科技(688507.SH)完成对美梦空间独家种子轮战略投资,双方在数据、算力、物理AI等技术层面深度协同,共同推进世界模型研发与产业应用落地。而Physical-WAM和RoboTwin-Phys正是双方携手给业界带来的一张新答卷。

Physical-WAM:让具身智能“理解”物理

具身智能向前推进时,首先撞上的是训练信号的源头。

计算机视觉与大语言模型领域获取训练样本的边际成本较低,网页文档、图片视频可以通过互联网获取标注。

原文配图 3

机器人与文本、图像、视频相比,训练数据与样本稀少

机器人物理交互数据的生产逻辑则完全不同。有效的物理交互样本诞生于真实或高保真仿真的接触过程:抓取、推拨、按压,每一次有效交互都伴随真机运动、接触反馈和物体状态改变。这类数据采集周期长,硬件损耗成本高,不同机器人本体之间还存在明显的数据迁移壁垒。

由此形成客观现实,机器人可用的真实物理交互样本仅维持在百万量级,和文本图像领域数十亿级别的数据体量相比,存在数万级别的落差。

原文配图 4

Physical-WAM概念图

面对数据供给的现实约束,美梦空间提出Physical-WAM作为针对性解法。整套架构的核心设计,是在感知信号输入和动作输出链路之间,插入一层“物理Token”表征。

传统世界模型的中间表征是像素或隐空间向量。它虽然可以推演物理世界的演化,但无法感知物理本身——知道“下一帧画面会变成什么样”,却不知道“为什么会变成这样”。Physical-WAM作为业内首个具备物理感知能力的WAM基模,基于可观测数据与深层物理数据训练,能在真实任务中实时觉察物理变化,并预判动作后果、实时修正行为。

原文配图 5

Physical-WAM三大模块架构图

Physical-WAM由PhysLens、PhysDream、PhysAct三个模块构成,形成“感知→预测→生成→修正”的反馈链条。

PhysLens是“物理翻译器”,从多模态感知信号中提取摩擦、重量、重心、接触状态等不可直接观测的物理信息,输出统一的物理Token表征。对照来看,现有VLA学到的是反应式的观测到动作映射,模型知道何时该伸爪、旋转或松手,却不显式推断物体有多重、表面是否湿滑。PhysLens要补的正是这层显式估计。

PhysDream是“物理预言家”,结合当前物理表征、环境状态和候选动作推演未来物理状态,预测打滑、脱手等风险并给出不确定性评估。PhysAct则负责物理条件化动作生成,把物理属性与未来状态预测引入动作生成,当环境发生物理漂移时自动调整执行策略。

原文配图 6

Physical-WAM三大模块架构解析

举一个直观的例子:机器人抓握纸杯时,PhysLens识别出纸杯材质的低刚度特性,PhysDream预测注水后负载增加可能导致杯壁形变或滑脱,PhysAct据此调整抓握力度和接触位置,在注水过程中持续修正策略,直至完成操作。

这不再是简单的动作复现,而是像人类一样,凭借“物理直觉”随机应变。

RoboTwin-Phys:把物理扰动变成可控变量

技术路线的竞争最终需要评测来裁决。

原文配图 7

美梦空间测试机器人的物理理解力

现有的具身智能评测基准存在一个结构性盲区:它们测量的是“任务完成度”,而非“物理适应度”。一个模型可以在固定摩擦系数、固定物体质量的标准测试集上刷出高分,却对物理参数的扰动毫无鲁棒性。

比如,同等推力下,高摩擦的罐子原地倾倒,低摩擦的罐子直接滑飞;夹持擀面杖同一位置,重心偏移就会引发杆体摆动。这些现实世界中大量司空见惯的“物理漂移”,却很难在传统测评中得到有效验证。一项能力无法被度量,模型的迭代优化就失去了锚点。

模型之外,美梦空间的第二个答案是重新建立一把评测标尺——RoboTwin-Phys物理漂移测评基准。这是业内首个以物理因素扰动为核心评测对象的机器人操作基准,能够把现实中抽象的物理参数,转化为可控、可标记、可复现的变量。

原文配图 8

RoboTwin-Phys概念图

这套评测基准遵循三层递进逻辑:物理属性推断准不准、物理扰动下任务还成不成、性能差距的上界在哪里。它在RoboTwin的基础上,新增了13类真实世界常见的物理扰动因素,从物体属性、接触属性、阻尼、任务环境到相机配置五大维度,支持单因素扰动到多因素组合扰动测评。

其工程价值主要体现在三点。第一,提供物理真值——物理值、接触力日志、物体运动学数据和失败时间线,使评测不只回答“成没成功”,还能追问“模型是否估计对了、何时开始失败”。第二,固定种子配对评估,让不同模型面对相同扰动实例,减少运气成分。第三,按推断准确性、扰动下任务成功率、性能上界逐层递进,区分“物理状态识别错了”和“识别对了但动作策略没跟上”。这等于在“感知—预测—生成”链条每一环各设了一个考位。

RoboTwin-Phys发布即开源,项目代码、数据集与排行榜全部开放,支持第三方验证复现,为行业立起一把衡量“物理AI”的标准化标尺。

物理感知的下一步:边界探索与纵深推进

“世界模型”本身仍是一个尚未收敛的概念,学术界至今没有统一的技术定义。计算机视觉研究者把它理解为视频生成,机器人领域把它当成状态预测器,强化学习圈子则从MBRL出发将其视为环境代理。

毕马威2026年7月发布的《跨越奇点:世界模型如何重塑具身智能产业与商业新范式》报告,提供了一个更清晰的坐标系:表征式世界模型回答“世界是什么”,生成式世界模型回答“世界会变成什么”,交互式世界模型回答“改变世界会发生什么”,而理解-生成-预测一体化世界模型则试图回答“如何理解、预测并自主改变世界”。

可以看到,美梦空间Physical-WAM为物理AI探索了一条可行的技术路径,并仍在持续拓展能力边界。

第一,物理Token的粒度边界在哪?摩擦、质量、重心是三个高度抽象的参数,但真实接触中还存在表面粗糙度的各向异性、材料的非线性弹性行为、接触面积的动态变化。当前表征能力的上限,需要更系统的消融研究来回答。

第二,跨本体的物理迁移效率如何?同一个物体,二指夹爪和灵巧手抓取所需的动作策略不同。物理参数到动作的映射,高度依赖末端执行器的形态与动力学特性。多本体适配的一致性和效率,是检验架构泛化能力的关键指标。

第三,仿真物理的保真度天花板在哪?PhysDream的推演精度受限于仿真引擎的物理保真度和真实传感器的噪声水平。当真实世界存在仿真无法建模的效应,比如织物的非线性大变形、颗粒材料的流动等,那么这套闭环的鲁棒性边界在哪里?

原文配图 9

9月26日,美梦空间CEO李明昊在第五届全球数字贸易博览会首发首秀主舞台上,介绍Physical-WAM如何让机器人读懂物理世界

围绕这些方向,美梦空间的下一步路线将围绕“视觉先行,力触声递进”持续迭代多模态物理表征模型,扩充物理交互数据集,优化模型推理延迟与多本体适配能力,并联合产业链上下游补齐物理数据、世界模型、评测标准三块拼图。

“只有让机器人真正读懂物理世界,具身智能才能大规模从实验室走向真实产业场景。”美梦空间CEO李明昊表示,将以开源开放的态度,推动行业加速走向具身智能的“GPT时刻”。

本文由美梦空间提供,量子位获授权转载,观点归原作者所有。