中文

评估人机交互中个性化价值对齐的影响:关于信任与团队绩效结果的洞察

机器人学 2023-11-28 v1

摘要

本文考察了机器人奖励函数实时、个性化地对齐人类价值对信任与团队绩效的影响。我们提出并比较了三种不同的机器人交互策略:非学习策略,其中机器人假定人类的奖励函数与其自身相同;非自适应学习策略,其中机器人学习人类奖励函数以进行信任估计与人类行为建模,但仍优化其自身奖励函数;以及自适应学习策略,其中机器人学习人类奖励函数并将其采纳为自身函数。我们进行了两项共有 54 名参与者的人体实验。在两项实验中,人机团队在一个城镇中搜寻潜在威胁。团队依次经过搜索点寻找威胁。我们将人与机器人之间的交互建模为信任感知马尔可夫决策过程(trust-aware MDP),并使用贝叶斯逆强化学习(IRL)来估计人类在与机器人交互时的奖励权重。在实验 1 中,我们以关于人类价值/目标的知情先验启动学习算法。在实验 2 中,我们以不知情先验启动学习算法。结果表明,当以良好的知情先验开始时,个性化价值对齐似乎无益于信任或团队绩效。另一方面,当知情先验不可用时,对人类价值的对齐带来了高信任与更高的感知绩效,同时保持相同的客观团队绩效。

关键词

引用

@article{arxiv.2311.16051,
  title  = {Evaluating the Impact of Personalized Value Alignment in Human-Robot Interaction: Insights into Trust and Team Performance Outcomes},
  author = {Shreyas Bhat and Joseph B. Lyons and Cong Shi and X. Jessie Yang},
  journal= {arXiv preprint arXiv:2311.16051},
  year   = {2023}
}

备注

10 pages, 9 figures, to be published in ACM/IEEE International Conference on Human Robot Interaction. arXiv admin note: text overlap with arXiv:2309.05179