宇树科技上市刚满一个月,市值已从超4400亿的高点滑落至约2000亿。与此同时,远在大洋彼岸,被称为“美国宇树”的机器人却展现出近乎“成精”的能力。
9月17日,Figure AI发布了新模型Helix 2.5,将机器人送入30个此前从未接触过的家庭,执行铺床、叠毛巾、整理玩具等任务。
这些工作它并非首次尝试。今年3月,Figure的机器人已能自主清扫客厅;5月,它在桑尼韦尔总部进行了约200小时的连续直播,3台机器人轮班作业,分拣了24.9万件快递。
但这次的新颖之处,在于Figure的机器人展示了 “换环境也能照常干活” 的能力。
做家务的人,到了别人家,通常无需从头学习铺床或叠衣物。但机器人换个地方,往往需要重新演示、采集数据、再训练一遍,才能适应新环境。
甚至只是各家的家具布局、物品尺寸不同,之前学会的动作就可能失效。
而Figure AI此次却直接将机器人部署到30个从未到访过的真实家庭,没有提前采集这些家庭的数据,也没有针对每家进行重新训练,就让机器人直接开始干活,并宣称实现了“零样本泛化”,简单来说就是“机器人到了新地方,不用重新学也能干活”。
难道,机器人保姆真的即将上岗?
不过,仔细审视成绩单,仅看数据的话,这次“泛化”并没有想象中那么神奇。
Figure共进行了420次测试,Helix 2.5成功完成了237次,整体成功率为56%。细分来看,铺床成功率67%,叠毛巾62%,整理玩具只有40%。
也就是说,它每干两次活,大约会失败一次。尤其是最后一项,十次里有六次都收拾不好,离真正能接管家务的机器保姆还差得远。
但56%这个成绩,在人形机器人做家务的泛化测试中,已算得上顶尖水平。据Figure的说法,这是人形机器人首次在如此多的真实家庭中,展示这种规模的零样本全身泛化。
官方还发布了一段3小时57分钟的完整视频。在这段视频中, Helix 2.5确实展现出了一些极具“人味”的动作。
比如铺床时,机器人发现自己站位不合适,会主动后退,重新调整姿态;被子没铺好,它还会绕到床的另一侧,换个位置继续整理。以前的机器人经常是动作一旦出错,后续就陷入僵局,甚至为了避免出错而直接罢工。
而现在,Helix 2.5最令人惊喜的是,它已经能在干活过程中发现问题时,立即想办法补救。
此时再回看今年5月那场200小时直播,两代机器人的差异就非常明显了。
当时的Helix 02能守在分拣台前连续工作,但这些能力依赖于在工作现场采集的数据。一旦工位变换,周围的设备和物品改变,即使是同样的分拣任务,机器人仍需重新采集数据和训练。
最终,虽然那场直播测试证明了Helix 02确实能持续工作,但并未证明它具备泛化能力,能随着环境变化灵活运用技能。
而这次呢?Helix 2.5可是换了整整30个地方。
每个家庭的床、家具和物品都不同,它依然能完成一半以上的任务。
|那么,在这么短的时间内,Helix 2.5为何进步如此之大?
Figure进行了一组对照实验,两边使用相同的任务数据,模型架构、训练方法和测试条件也完全一致,唯一的区别是其中一个模型提前观看过人类干活的视频。
结果,没看过的成功率只有9%,看过的直接提升到了56%。
那么,这套视频里到底有什么,能让机器人在陌生环境中的表现如此大幅提升?
秘密就叫做Index。
Index这个名字听起来很像某种复杂技术,但真相可能远比你想的简单。继续通俗解释, 就是Figure花钱请人干活,再把整个过程拍下来,拿去教机器人。
有人在家铺床、叠衣物、打扫卫生,也有人在餐厅收拾桌子、在商店补货,甚至还有人录下了铲猫砂和换机油的过程。只要愿意,普通人下载Index的应用,就可以把自己做事的视频上传给Figure,审核通过后还能获得美元报酬。
短短四个月,它就在108个国家积累了超过1600万条视频,每周还有4.4万人持续上传。Figure为此已支付了1500万美元。
不过,并不是随便拍一条扫地的视频上传就能轻松拿钱。这些经过审核上传的视频,都有一个重要前提:不重复。
Figure会对上传内容进行筛选、去重,并检查是否存在作弊和大量重复。根据公司公布的数据,每1000小时的Index视频,大约涉及373种任务、1146种物品和116种环境。
最终在Index上,同样是铺床,有人从床头开始,有人先抖开被子;同样是整理房间,每家摆放的家具、需要收拾的物品也不一样。同一类型的任务有着五花八门的解法,主打一个“贵在真实”。
而且这些同一任务的不同变化,都是自然产生的,再厉害的工程师也不可能坐在实验室里,一条条模拟、设计出来。
于是,Figure的机器人真正开始练习之前,就已经通过观看大量人类如何与现实世界打交道的真实视频,先培训再上岗。
有了这些视频打底,Figure就可以先把训练的顺序整个调过来。
过去,机器人通常是先确定要学什么,再围绕这项任务收集数据:教叠毛巾,就安排机器人反复叠毛巾。
现在Helix 2.5反着来,先在Index里预训练,见过足够多的人、物品和环境,再去学铺床、叠毛巾和收拾玩具。
这套思路,与大模型的预训练如出一辙:先海量“见世面”,再专门学手艺。
前面的对照实验已经证明,这一步确实有用。同样一批家务训练数据,交给一个看过大量人类示范的模型,到了陌生家庭,表现完全是两个样子。
这也解释了Helix 2.5为什么能在30个家庭里临场调整。只要此前见过的动作和场景足够多,遇到床铺尺寸变化、站位不合适或者东西没放好时,它的脑子里就多了几种可以尝试的办法。
不过,既然1600多万条视频已经让Helix 2.5学会了一些举一反三,那么再多一倍、两倍,甚至十倍的数据,它还会继续变聪明吗?
其实喂的数据越多,大模型的效果越好,这在AI大模型领域,早就是一条金科玉律,也就是Scaling Law。
所以这些年,各大模型公司都在抢着买更多算力、收集更多语料,再把模型规模越做越大。因为按照Scaling Law,只要数据和算力继续增加,模型通常就会按照一定规律变强。
这次Figure给机器人喂了2倍、4倍甚至8倍的Index数据,从操作上看,也有点像是在机器人身上复刻大模型的Scaling Law。
那么,机器人这边也有Scaling Law吗?
你还别说,真给Figure测出来了。
研究人员一共训练了四组模型,最大一组使用的Index数据,是最小一组的8倍。模型大小、后续的家务训练以及其他条件全部保持一致,只改变预训练时给机器人看过多少人类视频,然后只盯一个指标:机器人预测下一步动作的误差。
结果,Figure发现:随着Index数据增加,机器人的动作预测误差还真的一直在下降。 而且这条线降得很规整,数据每增加一档,误差会减少多少,已经能够提前估算。
Figure还用前三个模型的数据拟合出这条曲线,在最大那次训练开始之前,直接算出了它的误差。等训练跑完一看,实际结果和预测对到了小数点后四位。
这么看,机器人好像真有自己的Scaling Law。Figure还给这条曲线起了名字: “人类到人形机器人的迁移Scaling Law”:
这条曲线,解的是机器人行业的一个老大难: 过去想让机器人更强,只能采集更多机器人数据,又贵又慢。
但如果人干活的视频能按可预测的规律变成机器人的本事,投入多少、产出多少,就能照着这条曲线提前算出来,要花多少钱,心里有数。
Figure愿意继续收数据、买算力,赌的就是这条曲线成立。
9月3日,Figure宣布与AI云计算公司Nscale合作,计划从2027年下半年开始部署英伟达Vera Rubin平台,最终最多使用10万块GPU。最初承诺的算力投入达到35亿美元,未来意向是扩大到60亿美元以上。
35亿美元买算力,这更像是大模型公司的做法。而且Nscale不只是卖算力,还战略入股了Figure,成了它的股东。 黄仁勋在官宣里也说,这次合作“激活了机器人飞轮”。
另一边,Index每秒钟还在收到大约35分钟的人类行为视频。
一边是全世界的人不断拍下自己怎么干活,另一边是最多10万块GPU等着把这些视频喂给机器人。Figure作为一家机器人公司,却走在一条越来越像大模型公司的路上。
不过,目前这条被称为“人类到人形机器人的迁移Scaling Law”的曲线,还有挺多问题。它一共只有四个点,跨度只有8倍,撑不起一条定律。
比如实验测的是动作预测的误差,不是任务成功率。误差降了,也不代表喂的数据越多,家务就干得越好。
而且56%的成绩是Figure自己打的分,30个家庭全是湾区租来的房子,三项任务也是提前选好的。
尽管Figure在这次家务测试中迈出了重要一步,但距离大家请到一位机器保姆,还有很远的距离。
参考资料: APPSO《刚刚,机器人首次「空手闯进」 30个陌生家庭,进门就干活》 极客公园《Figure AI宣称找到了机器人版scaling law,同行却说它其实根本不会泛化》 本文来自微信公众号“蓝字计划”,作者:Chester,36氪经授权发布。
围绕为剧情体验新手提供分步骤入门教程,减少阅读困惑。,开云体育娱乐持续打磨更优质的服务。