36氪9月7日刊发光象科技媒体交流实录:公司联合清华李升波课题组发布物理原生世界模型Phi-WM 1.0 ActEffect,强调在隐空间学习状态转移与动作因果;Phi-Bot X1已在多家汽车工厂真实产线进入部署收尾,商业化数字暂未披露。 世界模型最近成了具身圈子的高频词,但每家对它该学什么并不一致。36氪9月7日刊出光象科技创始人兼CEO张涛、首席科学家吕尧的媒体交流实录:公司联合清华大学李升波教授课题组发布第一代物理原生世界模型Phi-WM 1.0 ActEffect,把重点放在物理状态、状态转移,以及动作会如何改变世界,目标是提高泛化,而不是再堆一条更长的在线推理链。 吕尧把“物理原生”拆成两层:模型从设计上面向机器人与真实物理交互;训练上希望从交互数据里学到动作驱动状态变化的因果关系。他们对主流VLA的判断是:模仿示范映射强,但环境理解与长程推理受限,且语言token到动作空间存在模态鸿沟。因此团队更强调在隐空间表征世界状态,并单独学习动作对状态转移的影响;能用动力学明确描述的位置、速度、力等显式状态,不必全部交给神经网络重学。 数据观也被写得很锋利。吕尧认为,仅靠成功示范做模仿学习,模型差距有限;真正拉开上限的是同一状态下不同动作及其成败结果构成的反事实数据。张涛则用抛掷异形物体入筐作比方:若只拟合成功轨迹,换新物体还要大量试错;若理解重力与形状等底层规律,适应会更快。这些是方法论主张,文中没有给出可独立复现的新基准表,读者仍需等待论文或开源评测。 落地进度同样保持克制。张涛称商业化具体数字暂不方便披露,但Phi-Bot X1已在多家汽车制造工厂的真实产线上进入部署收尾,希望到2026年底看到机器人真正进入产线运行并呈现效果。交流还谈到工位替换要看人机成本结构与协同安全冗余。把这番话放回产业日历:它解释了为何有人要把世界模型留在训练场——执行链路越短,越可能扛住工厂对时延与算力成本的账本;至于能否过验收,仍取决于现场节拍与故障率,而不是访谈里的路线图。