OmniH2O:通用人形机器人全身遥操作与学习
论文:OmniH2O: Universal and Dexterous Human-to-Humanoid Whole-Body Teleoperation and Learning
作者:Tairan He, Zhengyi Luo, Xialin He, Wenli Xiao, Chong Zhang, Weinan Zhang, Kris Kitani, Changliu Liu, Guanya Shi
发表:CoRL 2024,正式论文集收录于 PMLR 270(2025)
论文页面:PMLR
项目主页:OmniH2O
代码:LeCAR-Lab/human2humanoid
1. 一句话总结
OmniH2O先在仿真中用完整状态和完整参考动作训练一个特权教师,再通过DAgger将教师蒸馏为只依赖机器人本体感知历史和头、双手三个目标点的学生策略,从而让同一个低层策略能够在Unitree H1实机上接收VR、RGB、语言模型或模仿学习策略产生的运动目标,完成全身遥操作和简单自主任务。
其核心链路可以概括为:
2. 论文想解决什么问题
论文关注的不是单纯让人形机器人行走,而是让全尺寸人形机器人同时具备:
- 稳定的下肢平衡与移动能力;
- 精确的上肢动作和物体操作能力;
- 易于使用的遥操作接口;
- 从遥操作数据进一步学习自主任务的能力。
传统方案存在三个主要矛盾。
2.1 全身控制与任务控制之间的矛盾
只给机器人速度指令或落脚点目标,适合训练行走,却不能直接表达挥拍、弯腰取物、拥抱、写字等全身动作。若上下肢由不同控制器分别控制,又难以保证操作过程中上下肢的协调。
2.2 仿真信息丰富,实机观测有限
仿真中可以获得所有刚体的位置、姿态和速度;实机上却很难准确获得全身状态,尤其是全局线速度。直接用实机可用的稀疏观测训练强化学习策略,优化难度较大。
2.3 完整人体动作输入与便捷遥操作之间的矛盾
完整动作捕捉设备能够提供全身姿态,但成本高、使用范围有限。VR设备通常只能稳定提供头部和双手的位姿,因此控制策略必须根据稀疏目标补全合理的全身动作。
OmniH2O的解决思路是:
将“运动学姿态”作为统一控制接口,再用特权教师—学生框架把完整动作跟踪能力压缩到一个可实机部署的稀疏输入策略中。
3. 整体系统结构
OmniH2O包含三个相互连接的部分。
3.1 低层全身控制策略
低层策略接收运动目标和机器人本体状态,输出19个目标关节角。目标关节角再由PD控制器转换为电机控制量。
- 策略频率:50 Hz;
- PD控制频率:200 Hz;
- 策略控制对象:Unitree H1的19个身体关节;
- 策略网络:MLP,隐藏层为 。
需要注意,论文所说的“dexterous whole-body control”并不意味着手指也由同一个强化学习策略端到端控制。身体策略负责19个身体关节,手部姿态由VR估计,再通过逆运动学和现成的低层手部控制器映射到灵巧手。
3.2 通用运动目标接口
系统统一使用运动学姿态作为上层与低层控制器之间的接口。运动目标可以来自:
- VR头显和控制器;
- RGB人体姿态估计;
- 文本到动作模型;
- 动作捕捉系统;
- GPT-4o选择的动作原语;
- 从遥操作数据训练的模仿学习策略。
不同上层模块不直接输出电机动作,而是产生头部和双手等位置目标,再交给同一个OmniH2O低层策略执行。
3.3 遥操作数据与自主策略
作者用VR遥操作收集第一视角RGBD、运动目标和机器人关节指令,然后训练视觉模仿学习策略。视觉策略负责预测未来运动目标,OmniH2O继续充当低层执行器。
因此系统被分成两个层次:
4. 人体动作数据如何处理
4.1 AMASS动作重定向
作者将AMASS中的人体动作重定向到H1机器人,并使用可行性过滤器去除机器人难以执行的动作。最终用于仿真评估和训练的增强数据集约有14,000条动作序列。
论文沿用了H2O的重定向思路,没有把动作重定向作为主要创新。
4.2 为什么要增加站立和下蹲数据
作者发现,如果直接使用自然人体动作分布训练,策略容易通过不断迈小步维持平衡,难以在上肢操作时保持下肢静止。
为此,每条重定向动作还会生成“稳定版本”:
- 固定根节点位置;
- 将下肢固定为站立或下蹲姿态;
- 保留需要跟踪的上肢动作。
这相当于有意改变训练数据分布,让策略反复学习:
上半身运动时,下半身不一定需要迈步,也可以保持站立或下蹲。
这一设计的意义不是增加动作多样性,而是纠正训练数据中“运动多、稳定姿态少”的分布偏差。论文给出了定性消融:没有这类增强时,机器人较难静止站立并完成上肢动作,但没有报告对应的量化指标。
5. 特权教师如何训练
5.1 教师为什么拥有特权信息
教师策略只在仿真中使用,其目标是尽可能容易地学会完整Motion Tracking。因此教师可以看到实机难以直接测量的信息,包括所有刚体的:
- 位置与旋转;
- 线速度与角速度;
- 当前状态与完整参考动作之间的差值;
- 上一步动作。
教师观测总维度为913,参考目标覆盖机器人全部刚体,而不是只有头和双手。
教师通过PPO训练,输出19维目标关节角。它的作用不是直接部署,而是先在信息充分的条件下求得一个高质量动作标签生成器。
5.2 奖励函数
教师奖励由三类组成。
任务跟踪奖励
- 关节位置与速度跟踪;
- 刚体位置与旋转跟踪;
- 刚体线速度与角速度跟踪;
- VR三点位置跟踪。
正则项
- 关节加速度和速度;
- 上、下肢动作变化率;
- 力矩;
- 足端接触力与滑动;
- 足端姿态;
- 机体倾斜;
- 双脚同时离地。
安全与物理约束
- 力矩越界;
- 关节位置越界;
- 关节速度越界;
- Episode异常终止。
论文在附录中公开了各项表达式和权重,因此奖励部分比只列奖励名称的论文更容易复现。
5.3 Max feet height for each step
作者认为传统的feet air time或feet height奖励可能使机器人为了获得奖励而不断跺脚。OmniH2O增加了“每一步的最大足高”奖励:在一次摆动期间,根据脚达到的最大高度给予奖励。
其设计目标是同时区分两种情况:
- 不需要移动时保持稳定站立;
- 确实迈步时迈出幅度清晰、足端高度足够的一步。
不过该效果不是单靠这一项奖励实现的,还依赖数据分布调整和奖励课程。
5.4 奖励课程
训练早期,如果立即启用全部高权重惩罚,策略可能很难探索到基本动作。论文因此对负奖励统一乘以动态系数 ,正奖励保持不变:
初始为0.5:
- 平均Episode长度小于40时,乘以0.9999,进一步减弱惩罚;
- 平均Episode长度大于120时,乘以1.0001,逐渐增强惩罚;
- 最大值限制为1。
课程逻辑是:
5.5 域随机化
训练还随机化了:
- 摩擦系数、质心偏移和连杆质量;
- PD增益与力矩扰动;
- 20--60 ms控制延迟;
- 参考动作偏移;
- 每5秒一次的外部推力;
- 平地、粗糙地形和低矮障碍。
这些随机化用于缩小仿真与实机之间的差距,并提升抗扰动能力。
6. 可部署学生策略
6.1 学生只看什么
学生策略不再看到完整刚体状态。当前时刻的输入包括:
- 19维关节位置;
- 19维关节速度;
- 3维根节点角速度;
- 3维重力方向;
- 19维上一时刻动作;
- 27维稀疏运动目标。
当前输入共90维。
其中27维运动目标来自头部和双手三个点,包含这些目标与当前状态的相对信息及目标位置。策略不依赖完整人体姿态,也不显式输入机器人的全局线速度。
6.2 为什么使用25步历史
学生额外输入过去25步的本体感知历史。每个历史时刻包含:
- 关节位置;
- 关节速度;
- 根节点角速度;
- 重力方向;
- 历史动作。
每步63维,因此学生总输入为:
历史的作用主要有两个:
- 通过状态随时间的变化隐式推断机体运动速度;
- 根据之前的运动趋势缓解三点目标造成的姿态歧义。
论文比较了0、5、25、50步历史以及GRU、LSTM结构。最终选择将25步历史直接拼接后送入MLP。结果表明,递归网络并没有优于简单MLP。
6.3 为什么不输入全局线速度
H2O依赖全局线速度,但实机上通常需要VIO或外部MoCap估计。VIO可能存在噪声和不连续,估计误差会直接污染策略输入。
OmniH2O的关键取舍是:
不向策略提供不可靠的全局线速度,而是让策略从本体感知历史中隐式恢复运动信息。
这并不意味着系统完全不需要定位。论文仍需要根节点里程计,将VR等设备产生的目标转换到机器人坐标系中;去掉的是低层策略中的显式全局线速度观测。
7. DAgger如何把教师蒸馏给学生
OmniH2O不是先让教师生成一个固定数据集,再进行一次离线行为克隆,而是让学生在仿真中亲自运行。
每轮过程为:
- 学生根据稀疏目标和本体感知历史输出动作;
- 环境按照学生动作演化,得到学生实际访问的状态;
- 在同一个状态上,用仿真器补全教师需要的特权观测;
- 查询教师在该状态下会输出什么动作;
- 用教师动作监督学生。
论文明确给出的蒸馏损失为:
DAgger的关键价值在于解决分布偏移:即使学生执行错误、进入教师训练轨迹之外的状态,教师仍会在学生当前状态上提供纠正动作。
因此,这里的学生学到的不是简单复现教师的标准轨迹,而是:
在自己造成的偏差状态中,仍然模仿教师如何继续控制和恢复。
8. 三点输入如何控制全身
OmniH2O只输入:
- 头部位置;
- 左手位置;
- 右手位置。
三点显然不能唯一确定全身姿态。例如,同样的手部位置可能对应站立、弯腰或下蹲。策略之所以仍能输出合理全身动作,是因为它从大规模动作数据中学习了人体运动先验,并结合当前机器人状态与历史运动趋势,选择训练分布中最可能且物理可执行的动作。
因此,三点控制本质上不是精确重建完整人体动作,而是:
它换取了接口便利性,但也必然牺牲部分动作可控性和跟踪精度。
9. 主要实验结果
9.1 仿真Motion Tracking
测试集包含约14,000条增强动作序列。成功标准为:任意时刻与参考动作的平均偏差超过0.5 m,则该序列失败。
| 方法 | 是否可部署 | 成功率 ↑ | 全局MPJPE ↓ | Root-relative MPJPE ↓ |
|---|---|---|---|---|
| 特权教师 | 否 | 94.77% | 126.51 mm | 70.68 mm |
| H2O | 是 | 87.52% | 148.13 mm | 81.06 mm |
| OmniH2O | 是 | 94.10% | 141.11 mm | 77.82 mm |
OmniH2O的成功率接近特权教师,并明显高于H2O;但它的位置跟踪误差仍高于教师。因此更准确的结论是:
学生基本继承了教师维持动作成功和不跌倒的能力,但没有完全继承教师的跟踪精度。
9.2 DAgger消融
| 训练方式 | 历史输入 | 成功率 ↑ |
|---|---|---|
| 直接RL | 无 | 90.62% |
| 直接RL | 25步 | 47.11% |
| DAgger | 无 | 93.80% |
| DAgger | 25步 | 94.10% |
直接用RL处理1665维长历史输入时,成功率降到47.11%;改用DAgger后恢复到94.10%。这说明DAgger的主要贡献不是让任何学生都突然变强,而是让高维历史观测的学习变得可行。
同时,无历史DAgger已经达到93.80%,与完整模型的94.10%非常接近。因此仅看仿真成功率,历史的收益很小;它更重要的价值体现在实机鲁棒性和去除线速度依赖上。
9.3 稀疏点数量消融
| 目标点数量 | 成功率 ↑ | 全局MPJPE ↓ |
|---|---|---|
| 22点 | 94.72% | 127.71 mm |
| 8点 | 94.31% | 129.30 mm |
| 3点 | 94.10% | 141.11 mm |
三点输入的成功率与完整输入接近,但全局位置误差明显更高。论文证明的是“三点足以保持较高动作成功率”,而不是“三点与完整动作输入同样精确”。
9.4 实机Motion Tracking
作者在20条站立动作上进行实机量化测试:
| 方法 | 全局MPJPE ↓ | Root-relative MPJPE ↓ | 加速度误差 ↓ | 速度误差 ↓ |
|---|---|---|---|---|
| H2O | 87.33 mm | 53.32 mm | 6.03 | 5.87 |
| OmniH2O | 47.94 mm | 41.87 mm | 1.84 | 2.20 |
无历史版本的全局MPJPE为83.26 mm,而25步历史版本降到47.94 mm,说明历史信息在实机上的价值远大于仿真成功率所反映的差异。
带VIO线速度的版本在测试中跌倒,无法完成实验;使用MLP或GRU估计线速度也没有优于完全不输入线速度的OmniH2O。
9.5 遥操作与抗扰动展示
作者在H1实机上展示了:
- VR与RGB遥操作;
- 挥拍、浇花、写字、拳击、搬运等全身任务;
- 草地、斜坡、碎石等地形;
- 人为推、打、踢等外部扰动;
- 文本到动作模型生成的语言控制动作。
这些结果证明系统具备较强的实机展示能力,但大多数属于视频定性结果,没有统一的任务成功率和扰动恢复指标。
10. 从遥操作走向自主任务
10.1 OmniH2O-6数据集
作者使用VR遥操作收集了六类任务:
- Catch-Release;
- Squat;
- Rock-Paper-Scissors;
- Hammer-Catch;
- Boxing;
- Basket-Pick-Place。
数据以30 Hz记录,包含:
- 头部相机的第一视角RGBD;
- 相对机器人根节点的头部和双手目标;
- 电机执行所需的关节目标。
数据总时长约40分钟。
10.2 分层模仿学习
视觉模仿学习策略不直接预测19个关节动作,而是根据图像预测未来若干帧的运动目标和手部指令,再由OmniH2O低层策略转成全身动作。
这种分层结构复用了已经学好的平衡和全身协调能力,因此上层任务策略不需要从少量示范中重新学习机器人动力学。
在四个任务、每个任务10次测试的平均结果中:
- 普通行为克隆成功率为1/10;
- Diffusion Policy-DDIM为7.75/10;
- Diffusion Policy-DDPM为8/10。
结果还表明,预测动作序列比只预测单步动作更有效。
10.3 GPT-4o控制的实际含义
论文中的GPT-4o并不直接连续输出机器人关节动作或三点轨迹。系统向GPT-4o提供第一视角图像和预定义动作原语,由它根据视觉上下文选择动作。
因此这部分更准确地说是:
GPT-4o负责高层动作原语选择,OmniH2O负责低层物理执行。
作者没有证明GPT-4o能够实时生成连续、精细的全身控制信号。
11. 论文的主要优点
11.1 找到了实机可用的状态空间设计
论文没有只追求仿真指标,而是针对实机测量问题做出明确取舍:去除不稳定的全局线速度,使用本体感知历史隐式补偿。这一点有实机消融支持。
11.2 教师—学生分工清晰
特权教师负责解决困难的强化学习探索问题,学生负责满足可部署观测约束。DAgger又让监督数据来自学生实际访问的状态,减少了离线蒸馏的分布偏移。
11.3 将稀疏遥操作接口与全身控制解耦
只要上层模块能给出统一的运动学目标,同一个低层策略就可以接入VR、RGB、语言模型和模仿学习策略。这种接口设计比为每种输入源重新训练低层控制器更容易扩展。
11.4 数据分布问题分析具体
论文明确指出,自然动作数据并不自动适合操作任务。增加站立和下蹲版本,是针对“机器人总用小碎步平衡”这一具体失败模式的修正。
11.5 从控制到数据再到自主学习形成闭环
系统不只展示遥操作,还利用遥操作收集数据,并用这些数据训练自主视觉策略。论文建立了如下完整链路:
11.6 实现细节相对完整
论文附录公开了状态维度、奖励项及权重、奖励课程、域随机化范围、网络规模和主要训练超参数,并提供代码和实机系统说明,复现条件明显好于只描述概念流程的工作。
12. 论文的局限
12.1 实机量化测试范围较窄
实机Motion Tracking只量化评估了20条站立动作。论文虽展示了跑动、操作和户外地形视频,却没有系统报告:
- 高动态动作成功率;
- 行走和转向跟踪误差;
- 跌倒率;
- 不同地形通过率;
- 扰动大小与恢复时间;
- 长时间连续运行稳定性。
因此实机量化结果还不足以证明其对所有展示动作都具有同等可靠性。
12.2 三点目标存在不可消除的动作歧义
头和双手无法唯一确定腿部动作、身体朝向和具体姿态。策略输出依赖训练数据先验,因此对训练分布之外的稀疏目标可能产生与操作者意图不同的全身动作。
12.3 灵巧手没有与全身策略端到端联合学习
论文的强化学习策略控制19个身体关节;手指和部分腕部控制通过VR映射、逆运动学及独立手部控制器完成。因此其“全身灵巧操作”仍是学习式身体控制与工程化手部控制的组合。
12.4 仍然依赖根节点里程计
虽然低层策略不再需要全局线速度,但系统仍需要根节点定位,才能把VR或其他接口的目标转换到机器人坐标系。VIO噪声和跳变仍可能导致目标错误。
12.5 没有形式化安全保证
作者明确承认,面对极端扰动或分布外、突变的运动目标时,系统没有安全检查或稳定性保证。对于全尺寸人形机器人,这会限制开放环境部署。
12.6 主要跟踪基线较少
量化对比主要集中在同一团队此前的H2O以及论文自身的教师和消融版本。论文较好地证明了相对H2O的改进,但没有与更多同期通用人形跟踪方法进行统一比较。
12.7 自主学习数据规模与任务数量有限
OmniH2O-6只有约40分钟、六类任务,量化学习实验只覆盖其中四类。它证明了从遥操作数据学习自主技能的可行性,但还不能证明方法能够扩展到大规模、多场景的通用自主策略。
12.8 GPT-4o只做离散高层决策
GPT-4o实验展示了视觉语义与机器人控制的连接,但受响应延迟影响,它只在预定义动作原语中进行选择。这并不是端到端视觉—语言—全身连续控制。
13. 最值得掌握的结论
13.1 特权教师不是最终策略
特权教师的价值是降低强化学习探索难度,并为受限观测学生提供高质量动作标签。最终实机部署的是只使用可测量观测的学生。
13.2 历史观测和DAgger是一组配套设计
历史信息可以补偿显式速度缺失,但会显著增加输入维度;直接用RL处理长历史效果很差,DAgger则把问题转化为有教师标签的监督学习。
13.3 三点输入强调的是可用性,不是完整可观测性
三点目标让VR等消费级设备能够控制机器人,但全身姿态由动作先验补全。它取得的是“较少输入下仍能稳定完成合理动作”,而不是对操作者完整姿态的精确复现。
13.4 数据分布会直接塑造控制习惯
如果训练集中缺少静止站立和稳定下蹲,策略可能学会通过不断迈小步维持平衡。Motion数量大并不等于行为分布适合目标任务。
13.5 统一的中间接口使系统容易扩展
运动学目标把语义层与动力学控制层分开:上层只需决定目标动作,低层策略负责平衡、协调和执行。这是OmniH2O能够同时连接多种遥操作和自主模块的关键。
14. 总体评价
OmniH2O不是以全新的强化学习算法为核心,而是一篇系统性很强的人形机器人论文。它把动作重定向、特权教师、DAgger蒸馏、历史观测、稀疏控制接口、域随机化、遥操作数据采集和模仿学习组织成了一条完整的实机链路。
论文最有说服力的部分是:
- 学生的成功率接近特权教师;
- DAgger能够处理直接RL难以学习的长历史输入;
- 实机历史观测可以替代不可靠的全局线速度;
- 同一个低层控制策略可以接入多种上层控制接口。
论文最需要谨慎看待的部分是:
- 实机量化只覆盖20条站立动作;
- 三点输入无法唯一确定全身姿态;
- 灵巧手控制并非端到端学习;
- 自主学习实验的数据量和任务范围较小;
- GPT-4o只负责选择预定义动作原语。
最终,OmniH2O可以概括为:
它真正推进的不是某一个单独模块,而是让全身Motion Tracking从仿真能力变成了可被多种设备和智能体调用的实机基础控制能力。