中文

为人机团队学习互补策略

人工智能 2025-11-04 v2 人机交互

摘要

本文探讨决策中人机互补性的关键挑战。我们摆脱了传统上对算法性能的关注,转而重视人机团队的性能,并超越了将协作视为分类问题的框架,转而关注决策任务,从而引入了一种新颖的策略学习方法。具体而言,我们针对仅在分配动作下才能观察到结果的人机协作问题,开发了一种鲁棒解决方案。我们提出了一种延迟协作方法,通过利用人类和 AI 的独特优势来最大化决策奖励,并在它们之间策略性地分配实例。至关重要的是,我们的方法对人类行为模型和奖励模型的误设定均具有鲁棒性。利用性能提升源于人类与 AI 行为模式差异这一洞见,我们使用合成和真实的人类响应证明,我们提出的方法显著优于独立的人类和算法决策。此外,我们表明,仅将一小部分实例交由人类决策者处理即可实现显著的性能提升,这突显了在复杂管理环境中实现高效且有效的人机协作的潜力。

关键词

引用

@article{arxiv.2302.02944,
  title  = {Learning Complementary Policies for Human-AI Teams},
  author = {Ruijiang Gao and Maytal Saar-Tsechansky and Maria De-Arteaga},
  journal= {arXiv preprint arXiv:2302.02944},
  year   = {2025}
}

备注

Previous name: Robust Human-AI Collaboration with Bandit Feedback; Best student paper award at Conference on Information Systems and Technology (CIST), 2022