互联网上各类文本、图像和视频数据集庞大,但机器人的场景和交互有
价值的数据量相对较小,限制了 AI 模型在人形机器人上的泛化能力。
在 Coatue 的报告中提到,机器人场景数据集仅有 2.4M,远远低于文本
数据集的 15T Tokens 和图像数据集的 6B Images,相差好几个数量J。
机器人数据采集的方法有四种,目前主流的方法是远程操作和仿真:
1)远程操作:由实验人员操作机械手柄,远程控制机器人做出相同动作,
以此来积累数据。2024 年 5 月 5 日,Tesla Optimus 官方发布了新的 demo
视频展示了 Optimus Gen2 的新进展,从视频中可以看到,Optimus Gen2
的训练数据通过人类远程操作收集,并针对各种任务进行扩展。
2)增强现实:在名为《Explainable Human-Robot Training and Cooperation
with Augmented Reality》的研究中,研究人员通过 AR(增强现实)技术让人机交互过程具备更强的可解释性,进行数据积累。
3)仿真(合成数据):通过海量算力进行模拟运算,计算得出海量机器
人训练数据集。仿真可能是目前有可能做到规模化数据生成的路径,
背后需要巨大的算力支持。目前 Nvidia 采取的就是这条技术路径。
4)视频学习:通过多模态大模型,直接让机器人通过视频学习人类动作,
积累训练数据。
|