Figure AI于2026年9月17日在官网发布Helix 2.5:在Index人类行为数据预训练后,将整理客厅、叠毛巾、铺床三项全身长程行为放到湾区30套从未采集数据的住宅中做零样本评测;官方给出Index预训练策略成功率56%、从零训练对照仅9%,并称任务专用数据用量约为Helix 02代表性行为的一半。 人形机器人能不能像人一样,走进从没见过的房子就开始干活?Figure AI 9月17日在官网长文介绍Helix 2.5,把问题从“在训练过的场景里做长程全身控制”推进到“陌生住宅、陌生物体、零本地适配”。公司称策略先在自有Index人类行为数据集上预训练,再分别适配整理客厅玩具、折叠毛巾、铺床三项行为,随后进入湾区30套从未采集数据的家庭评测。 官方给出的关键对照可逐项核对:在任务数据、架构、训练与评测固定的条件下,仅改变是否做Index预训练,从零训练策略的零样本成功率为9%,Index预训练策略为56%,约为6倍差距;成功标准要求整项任务做完(玩具全部入篮、毛巾全部叠好入篮、枕头与被子角都到位),不给部分分。文中同时称Helix 2.5用于指定行为的任务数据量约为Helix 02代表性行为的一半,却把评测范围扩到30套未见过的住宅。 评测边界同样写进了官网稿:零样本指评测环境与被操作物体未进入任务数据;任务本身仍通过在其他地点采集的微调数据指定;每项任务跨30户使用同一冻结检查点,评测过程不做现场权重更新。另有一段人类数据到人形动作预测的缩放实验:在模型与下游训练固定时,Index预训练数据量按8倍嵌套子集增加,下游动作预测损失随数据翻倍平滑下降,并可用于预报更大规模训练的损失——这是公司自报的缩放律证据,不等于商业交付SLA。 对本站读者,库内对应机型挂「Figure AI / Figure 03」,封面用已有机型图。后续更有信息量的信号,是可复核的失败模式分布、真实家居连续班次与客户现场复现率,而不是把56%一次评测直接写成“家庭通用机器人已就绪”。