Rhoda 公布工业拆包任务测试,较大模型在限时完成率上表现更好;研究仅覆盖一个任务和一种设备,尚不能外推通用能力。 机器人从互联网视频里学到的东西,究竟能不能变成工厂中的有效动作?Rhoda AI 九月十日发布研究博客,用一项来自客户的轴承拆包任务检验这个问题。团队比较不同规模和预训练计算投入的视频模型,再用同一工业任务的机器人示范数据进行后训练,累计投入超过二百小时真机评测。这是九月十日的原始研究披露,近期传播并不改变它的实际发布时间。 任务本身比抓起一个方块复杂得多。按照官方说明,机器人需要处理每箱十公斤的轴承包装,完成提箱、寻找开口、打开盒盖、倒出轴承,并把纸板、塑料和纸张分别归类。公司称,一处客户现场每天需要人工拆开超过一千箱。测试把完整流程分为多个子任务,只有全部目标完成、没有人工介入且用时少于一百秒,才计为合格。文中配图来自公司官网,展示双臂机器人拆包设备的实际形态。 在完整示范数据条件下,研究报告中的较大模型取得百分之八十四点七的限时完成率,对应一百一十一次试验中完成九十四次;中等模型为百分之七十五点三。团队也发现,保持模型规模不变、增加预训练计算投入,能够改善任务表现;在示范数据减少的部分条件下,不同预训练投入之间的差距更明显。这些结果是公司在规定测试流程下的测量,不能写成客户产线已经达到同样的长期可用率。 Rhoda 对研究边界作了详细说明:全部评测只覆盖一个任务、一种机器人形态和一套场景,每种条件只进行一次后训练。模型大小比较还伴随着数据量和计算投入变化,因此无法把收益全部归因于参数数量。研究采用的一百秒门槛也比客户要求严格,用来拉开模型差异。预测视频的指标与机器人表现之间存在相关性,但相关性仍局限于此次架构和任务,尚未证明可以用于所有模型。 从这项披露作出的判断是,视频预训练的价值开始能够用完整工作流程来讨论。评估不仅要看动作是否成功,还要同时考虑耗时、人工接管和废料分类是否正确。下一步更有说服力的证据,是在不同任务和设备上重复评测,并公开连续运行结果。对产业而言,这次研究提供了一套可检验的实验口径;能否减少新场景所需的示范数据和部署成本,仍需要后续跨场景测试回答。