基于Bandit反馈的人机协作
人机交互
2021-12-14 v1
摘要
当算法和人类在给定领域的所有实例上均无法取得主导性表现时,人机互补性十分重要。大多数关于算法决策的研究仅关注算法自身的性能,而近期探索人机协作的工作将决策问题构建为分类任务。在本文中,我们首先提出并随后开发了一种新颖的人机协作问题在bandit反馈设定下的解决方案。我们的方案旨在利用人机互补性以最大化决策奖励。接着我们将方法扩展至包含多个人类决策者的设定。我们利用合成与真实人类响应证明了所提方法的有效性,并发现当算法和人类各自独立决策时,我们的方法均优于二者。我们还展示了在存在多个人类决策者的情况下,个性化路由如何进一步提升人机团队表现。
引用
@article{arxiv.2105.10614,
title = {Human-AI Collaboration with Bandit Feedback},
author = {Ruijiang Gao and Maytal Saar-Tsechansky and Maria De-Arteaga and Ligong Han and Min Kyung Lee and Matthew Lease},
journal= {arXiv preprint arXiv:2105.10614},
year = {2021}
}
备注
Accepted at IJCAI 2021