Research
AMS统一人形机器人全身控制框架:首次实现在单一策略中同时具备动态运动跟踪和极限平衡控制能力
November 24, 2025
极端平衡动作
叶问蹲 (未见数据的零样本泛化)
单腿平衡站立(动作为随机生成,旨在挑战机器人极限难度下的能力)
动态动作
奔跑
篮球运球
腰部动作(未见视频数据的零样本泛化)
弓步动作 (未见视频数据的零样本泛化)
摆动与深蹲 (未见视频数据的零样本泛化)
祈祷式下蹲 (未见视频数据的零样本泛化)
基于惯性测量单元(IMU)的遥操作
(未使用动作捕捉系统, 1x)
中国功夫
踢球
多机器人遥操作
基于RGB相机的实时遥操作
摘要

人形机器人被设想在以人为中心的环境中执行广泛的任务,这要求机器人既能具备敏捷性,又能保持稳健的平衡能力。近来在运动控制与全身跟踪方面的进展,使得机器人在“敏捷的动态技能”或“对稳定性要求极高的行为”这两类能力上分别取得了令人印象深刻的进步,但现有方法仍然偏向专用化,很难兼顾,大多只能专注于其中一种能力,并牺牲另一种能力。

在本工作中,我们提出 AMS(Agility Meets Stability,敏捷与稳定融合)——首个在单一策略(single policy)中同时统一动态动作跟踪与极限平衡保持的框架。我们的核心观点是利用异构数据源:一类是提供丰富、敏捷行为的人体动作捕捉数据集;另一类是受物理约束的合成平衡动作,用于刻画稳定性相关的姿态/配置。为协调“敏捷”与“稳定”这两种分歧明显的优化目标,我们还设计了一种混合奖励机制:在所有数据上施加通用的跟踪目标,同时仅在合成动作上注入与平衡相关的先验。在以上研究的基础上,我们提出一种自适应学习策略,结合基于性能驱动的采样与针对不同动作的奖励塑形,使得在多样化动作分布上能够实现高效训练。

我们在仿真环境以及Unitree G1 人形机器人上对 AMS 进行了全面验证(仿真测试、真机测试)。实验结果表明,单一策略情况下,搭载AMS框架的机器人不仅能够执行如跳舞、跑步等敏捷技能,还能以 zero-shot(零样本)方式完成诸如“叶问蹲(Ip Man’s Squat)”这类极限平衡动作,这表明 AMS 作为一种面向未来人形机器人应用的通用型控制范式具有极大潜力。

AMS概述

(a)通用的全身动作跟踪流程会将人类 MoCap(动作捕捉)数据重定向为参考动作,并采用一种基于教学关系(teacher-student)的强化学习策略。为应对数据限制以及相互冲突的优化目标,AMS 引入了如下三个关键组件。 (b) 生成的合成平衡数据,将作为人类 MoCap(动作捕捉)数据的补充部分,解决数据源不足的问题。 (c) 采用自学习的方式:基于每个单独动作的表现,进行自适应采样与奖励塑造(reward shaping)。 (d) 混合奖励机制(Hybrid rewards)被设计为,对所有动作发放通用奖励,同时只针对合成动作引入平衡先验奖励。

引用
@article{pan2025ams,
    title={Agility Meets Stability: Versatile Humanoid Control with Heterogeneous Data},
    author={Pan, Yixuan and Qiao, Ruoyi and Chen, Li and Chitta, Kashyap and Pan, Liang and Mai, Haoguang and Bu, Qingwen and Zheng, Cunyuan and Zhao, Hao and Luo, Ping and Li, Hongyang},
    journal={arXiv preprint arXiv:2511.17373},
    year={2025}
}
页面链接已复制