从最小观察逆强化学习中学习人类到达最优性原理
机器人学
2025-10-02 v1
摘要
本文探讨了将最小观察逆强化学习 (MO-IRL) 应用于建模和预测人类手臂到达运动的时变成本权重的问题。我们采用平面两杆生物力学模型,并使用主体执行指向任务时获得的高分辨率动作捕捉数据,将每个轨迹划分为多个阶段,学习每阶段的七种候选成本函数的组合。MO-IRL 通过缩放观察到的轨迹和生成的轨迹,在最大熵 IRL 框架下迭代细化成本权重,大大减少了所需演示的数量和收敛时间,相较于经典 IRL 方法表现更佳。每组姿势训练 10 次的轨迹,分别对六段和八段权重划分,平均关节角 RMSE 分别为 6.4 度和 5.6 度,而单一静态权重下为 10.4 度。对剩余轨迹的交叉验证,以及首次对未见主体的 20 条轨迹进行主体间验证,均显示出约 8 度的可比预测精度,表明其泛化能力稳健。所学习的权重在运动起始和终止阶段强调关节加速度最小化,与生物运动中观察到的平滑性原理相一致。这些结果表明,MO-IRL 能够高效地揭示人类运动控制背后动态的、与主体无关的成本结构,具有潜在的用于人形机器人应用的价值。
引用
@article{arxiv.2510.00329,
title = {Learning Human Reaching Optimality Principles from Minimal Observation Inverse Reinforcement Learning},
author = {Sarmad Mehrdad and Maxime Sabbah and Vincent Bonnet and Ludovic Righetti},
journal= {arXiv preprint arXiv:2510.00329},
year = {2025}
}
备注
8 pages, 4 figures