中文

基于置信度的逆 soft-Q 学习从不完美演示中对齐人类意图

机器人学 2024-07-09 v3

摘要

模仿学习因能使机器人通过演示快速学习人类操作技能而备受关注。然而在现实世界中,人类演示常表现出人类非预期的随机行为。收集高质量的人类数据集既具挑战性又成本高昂。因此,机器人需要具备从不完美演示中学习符合人类意图的行为策略的能力。先前的工作使用置信度分数从不完美演示中提取有用信息,这依赖于对真实奖励的获取或人类的主动监督。在本文中,我们提出一种基于状态转移的方法,无需上述努力即可为数据获取细粒度的置信度分数,这可使基线算法的成功率平均提高 40.3%。我们开发了一个用于指导策略学习的通用置信度模仿学习框架,称为基于置信度的逆 soft-Q 学习(CIQL),如图 1 所示。在此基础上,我们分析了两种处理噪声的方法,发现惩罚比对齐更符合人类意图。

关键词

引用

@article{arxiv.2312.11194,
  title  = {Aligning Human Intent from Imperfect Demonstrations with Confidence-based Inverse soft-Q Learning},
  author = {Xizhou Bu and Wenjuan Li and Zhengxiong Liu and Zhiqiang Ma and Panfeng Huang},
  journal= {arXiv preprint arXiv:2312.11194},
  year   = {2024}
}

备注

Our code see https://github.com/XizoB/CIQL