中文

从探索性动作进行对比学习:利用自然交互进行偏好 elicitation

机器人学 2025-01-03 v1 人工智能 人机交互 机器学习

摘要

人们对机器人行为的方式有各种各样的偏好。为了理解和推理这些偏好,机器人希望学习一个描述机器人行为与用户偏好多大一致的奖励函数。良好的机器人行为表征(representation)可以显著减少用户教授机器人其偏好所需的时间和精力。然而,指定这些表征——即哪些“特征”(features)对用户而言重要——仍然是一个困难问题;从原始数据中学习的特征缺乏语义意义,而从用户数据中学习的特征需要用户参与繁琐的标注过程。我们的关键洞察是,被要求定制机器人的任务中,用户本身就有动机通过探索性搜索来生成标签;他们会探索他们觉得有趣的行为,忽略无关的行为。为了利用这种新的探索性动作数据源,我们提出了从探索性动作进行对比学习(contrastive learning from exploratory actions, CLEA),以学习与用户关心的特征对齐的轨迹特征。我们在Kuri机器人上进行的一次开放性信号设计活动(N=25)中,从探索性动作中学习了CLEA特征,并在另一组用户(N=42)的第二次用户研究中评估了CLEA特征。CLEA特征在四项指标上(完整性、简单性、最小化和可解释性)均优于自监督特征。

关键词

引用

@article{arxiv.2501.01367,
  title  = {Contrastive Learning from Exploratory Actions: Leveraging Natural Interactions for Preference Elicitation},
  author = {Nathaniel Dennler and Stefanos Nikolaidis and Maja Matarić},
  journal= {arXiv preprint arXiv:2501.01367},
  year   = {2025}
}

备注

Accepted to HRI 2025