conformalized Interactive Imitation Learning: 处理专家分布迁移和间歇性反馈
机器人学
2025-05-01 v2 人工智能
人机交互
机器学习
摘要
在交互式模仿学习(IL)中,不确定性量化提供了一种方法,让学习者(即机器人)在部署期间通过主动从专家(即人类)在线寻求额外反馈来应对遇到的分布迁移。先前的工作使用诸如集成 disagreement 或蒙特卡罗 dropout 等机制来量化不确定的黑箱 IL 策略;然而,这些方法在面临部署时的分布迁移时可能导致过度自信的估计。相反,我们认为需要能够在部署时利用从专家处接收的人类反馈来在线适应机器人不确定性的不确定性量化算法。为此,我们借鉴了在线 conformal 预测,这是一种基于给定标签流构建在线预测区间的分布无关方法。在交互式 IL 设置中,人类标签是间歇性的。因此,从 conformal 预测侧,我们引入一种名为 intermittent quantile tracking (IQT) 的新型不确定性量化算法,该算法利用间歇标签的概率模型,保持渐近覆盖保证,并在实证上实现所需的覆盖水平。在交互式 IL 侧,我们开发了 ConformalDAgger,一种新方法,其中机器人使用由 IQT 校准的预测区间作为部署时不确定性的可靠度量标准,以主动查询更多专家反馈。我们将 ConformalDAgger 与先前的不确定性感知 DAgger 方法进行比较,在专家策略发生变化导致分布迁移(以及没有分布迁移)的情景中进行测试。我们发现,在仿真和硬件部署于 7 自由度机器人臂上,ConformalDAgger 在专家迁移时检测到高不确定性,并增加了与基线方法相比的干预次数,使机器人能够更快地学习新行为。
关键词
引用
@article{arxiv.2410.08852,
title = {Conformalized Interactive Imitation Learning: Handling Expert Shift and Intermittent Feedback},
author = {Michelle Zhao and Reid Simmons and Henny Admoni and Aaditya Ramdas and Andrea Bajcsy},
journal= {arXiv preprint arXiv:2410.08852},
year = {2025}
}