基于保守预测的主动模仿学习中的样本高效专家查询控制
机器人学
2025-12-02 v1 人工智能
机器学习
摘要
主动模仿学习(AIL)通过在训练期间查询专家动作来克服协变量漂移,但专家动作标注往往在 GPU 密集型模拟器、人机交互场景以及机器人编队等需要重复访问接近重复状态的情形下成本居高不下。我们提出基于保守预测的主动模仿学习拒绝抽样方法(CRSAIL),这是一种仅在访问的状态在专家标注数据集中缺乏代表性时才请求专家动作的查询规则。CRSAIL 通过状态与第 K 个最近专家状态之间的距离对状态新颖度进行评分,并通过保守预测设置单个全局阈值。该阈值是基于在策略下校准得分的经验分位点(1-α 分位),从而提供一种无分布假设的校准规则,将 α 与预期查询率关联,使 α 成为一个与任务无关的调优杠杆。这种状态空间查询策略对离群值鲁棒,且与安全阈值型 AIL 不同,无需实时专家接管:我们先对学习者执行完整轨迹(剧集),随后仅在子集访问状态上查询专家。在 MuJoCo 机器人任务上评估表明,CRSAIL 在减少总体专家查询方面,相较于 DAgger 最多降低 96%,相较于现有 AIL 方法最多降低 65%,同时匹配或超越专家水平的奖励,且对 α 和 K 的实验鲁棒性佳,便于在动力学未知的新系统上部署。
引用
@article{arxiv.2512.00453,
title = {Sample-Efficient Expert Query Control in Active Imitation Learning via Conformal Prediction},
author = {Arad Firouzkouhi and Omid Mirzaeedodangeh and Lars Lindemann},
journal= {arXiv preprint arXiv:2512.00453},
year = {2025}
}