Lazy loaded image
Figure 新模型零样本进 30 个陌生家庭干活
字数 2109阅读时长≈ 6 分钟
2026-9-18
2026-9-18
9 月 17 日,美国人形机器人公司 Figure 发布新一代神经网络 Helix 2.5。它要回答的问题很朴素也很难:一个机器人能不能走进一间从没见过的房子,不被重新调教、不重新采数据,直接开始收拾屋子?
答案被放进了 30 个真实的旧金山湾区家庭。Figure 把训练好的同一份模型权重带进这 30 个陌生家庭,让它整理客厅、叠毛巾、铺床——在这些房子里没有采集过一秒钟数据,没有微调,没有为任何一件玩具、毛巾或床品做适配。公司称,这是人形机器人首次在这种规模上实现「零样本全身泛化」。

「换一个家就失灵」是具身智能的老毛病

人能走进任何一间陌生的房子立刻干活,因为我们对物理世界的理解是可迁移的:床高不一样,也不影响我们知道怎么铺床。机器人不是这样——它们是「一个地方、一个地方地学」,训练环境在哪儿,能力边界就在哪儿。
更麻烦的是形态。桌面机械臂有固定的工作台,轮式机器人需要足够宽敞的地面;而家庭空间不会为机器做任何让步。人形机器人必须一边走一边调整站姿去够到东西,感知、移动、操作三件事没法拆开解决——这就是 Figure 所说的「全身泛化」难题:整理房间、叠毛巾、铺床三件事合起来同时压到了感知、行走、刚性与柔性物体操作、双手协同和主动观察。

Index:把「人类经验」当成预训练数据

Figure 的解法是把机器人学习拉回语言模型那条熟悉的路:先大规模预训练,再少量微调。预训练用的不是机器人数据,而是人类数据——Index,Figure 今年 8 月公开的全球人类行为数据集:靠一个手机 App 收集普通人做家务、清洁、理货等第一视角视频。
  • Index 已跨 108 个国家、累计 26.4 万次下载,4.4 万名周活跃用户持续上传。
按官方说法,Index 目前每秒新增约 35 分钟的人类经验视频。Figure 称,公司已承诺投入 35 亿美元算力训练 Helix 系列模型。

关键数字:9% 到 56%

为了证明「泛化能力来自预训练」而不是微调数据,Figure 做了一组单变量对照实验:两份策略用完全相同的任务数据训练,唯一区别是一份从随机权重起步,另一份从 Index 预训练过的 Helix 2.5 起步。架构、优化器、超参、下游数据与评测标准全部锁死。
盲测结果是 9% 对 56%——预训练带来的零样本成功率提升超过 6 倍。而且成功判定极严:整间客厅 13 到 15 件玩具必须全部归位,所有毛巾都要叠好入篮,枕头与被子四角都要拉到位且抚平,不给任何部分分;玩具 1 分钟、毛巾 3 分钟超时即判失败,需要人工干预以确保安全的回合直接记失败。
🎯
对照组里差距的唯一来源就是预训练。Figure 还强调预训练数据足够「宽」:任何单一评测任务在 Index 中的占比都不超过 1.90%。

一半的数据,30 倍的范围

更实际的一层意义在数据效率。与上一代 Helix 02 相比,Helix 2.5 只用了对方一半的任务数据,成功率持平,却把适用范围从「训练过的那间屋子」扩展到 30 个陌生家庭。按官方口径:行为定义的代价降低 2 倍,而覆盖范围扩大 30 倍。
在陌生环境里,长时序任务一定会出轨,所以自我纠错能力是硬指标。Figure 特别提到 Helix 2.5 的定性进步:发现自己够偏了会退后一步重新站位,会换个姿势,或者绕到床的另一侧修正被角。全部 30 个家庭共用同一份固定检查点,没有针对环境或物体做任何权重调整。

第一次量出「人类到机器人」的缩放定律

这篇发布里最有研究价值的一条,是 Figure 声称测出了首个「人类到人形机器人」的迁移缩放定律。他们把 Index 预训练数据做成嵌套子集(跨度 8 倍),保持模型规模与下游训练不变,测同一份留出的动作预测损失,结果每翻倍一次数据,损失就平滑下降。
拟合精度到了可以「预报」的程度:只用小规模实验的结果,就能在训练开始前把最大一次运行的测试损失预测准到小数点后四位,预测误差仅相当于整个 8 倍数据区间波动的 0.54%。如果这条曲线在更大规模上仍然成立,意味着机器人公司可以在烧掉算力之前,先估算「再翻倍人类经验能换来多少能力」——这正是语言模型时代的核心工程直觉。

冷静看:这还不是「通用机器人已解决」

Figure 自己在文末写了这句话:要点不是通用人形机器人已经被解决。几点需要留意:评测只在旧金山湾区的 30 个家庭完成,样本远小于工厂,也远小于真实家庭的多样性;三个行为(整理、叠毛巾、铺床)是提前用别处采集的数据定义好的,机器人还没学会「自己决定该干什么」;成功率 56% 意味着接近一半的回合仍然失败,距离可以放心交付给家庭的水准还有相当距离。
但方向上的意义清晰:过去两年人形机器人的进展主要靠硬件和单点演示,Helix 2.5 给的是一条可扩展的公式——用人类视频做大规模预训练,把新行为「定义一次」,然后在部署现场直接泛化。Figure 与拥有 10 万套住宅的 Brookfield 的合作,恰好是为这条路线准备的真实场景入口。

对国内具身智能意味着什么

中国团队在硬件与量产节奏上并不落后,差距更可能出现在「数据从哪里来」。Index 的做法是把数据采集变成消费级 App 的运营问题:下载量、周活、防作弊、去重与再平衡,本质是互联网公司的能力,而不是实验室的采集车。谁先把人类行为数据的获取管道规模化,谁就更容易复现这条缩放曲线。
另一个信号是评测标准的公开化。Figure 把评分细则、超时规则、是否给部分分都写进了附录,这类「可复核的苛刻评测」正在成为机器人公司的信誉资产——比起一段剪辑过的演示视频,能在 30 个陌生家庭里被第三方监督着反复失败的模型,才更接近产品。

参考来源

  • Figure 官方技术发布(2026-09-17):Helix 2.5: Zero-Shot 30-Home Generalization | figure.ai/news/helix-2-5-zero-shot-30-home-generalization
  • Figure 官方发布(2026-08-25):Introducing Index: Building The World's Largest and Most Diverse Physical Dataset | figure.ai/news/introducing-index
  • Unite.AI:Figure Introduces Helix 2.5, Tested Zero-Shot in 30 Unseen Homes | unite.ai
  • Dealroom:Figure Helix 2.5: zero-shot work in 30 unseen Bay Area homes | dealroom.co
上一篇
达摩院 RADAR 登《科学》:单模型识别 146 种病症并开源
下一篇
机器人结肠镜 Triton 1 获 FDA 清除