受动作约束的模仿学习
机器人学
2025-08-21 v1 机器学习
摘要
在动作约束下进行策略学习是确保各种机器人控制和资源分配应用中安全行为的核心问题。本文我们研究一种新问题设置,即受动作约束的模仿学习(ACIL),其中受动作约束的模仿者试图从动作空间更大的专家处学习。ACIL的根本挑战在于由于动作约束,专家与模仿者之间的占用分布之间不可避免地产生偏差。我们通过动作轨迹对齐来解决此偏差,提出DTWIL(Dynamic Time Warping Imitation Learning),将原始专家演示替换为遵循动作约束且状态轨迹相似的替代数据集。具体而言,我们将轨迹对齐问题重新表述为规划问题,并通过模型预测控制(Model Predictive Control)求解,基于动态时间Warping(DTW)距离将替代轨迹与专家轨迹对齐。通过大量实验,我们证明DTWIL生成的数据集显著提升了多个机器人控制任务中的性能,并在样本效率方面优于各种基准模仿学习算法。我们的代码已公开于https://github.com/NYCU-RL-Bandits-Lab/ACRL-Baselines。
关键词
引用
@article{arxiv.2508.14379,
title = {Action-Constrained Imitation Learning},
author = {Chia-Han Yeh and Tse-Sheng Nan and Risto Vuorio and Wei Hung and Hung-Yen Wu and Shao-Hua Sun and Ping-Chun Hsieh},
journal= {arXiv preprint arXiv:2508.14379},
year = {2025}
}
备注
Published in ICML 2025