利用离线强化学习优化 AI 辅助决策中以人为本的目标
人机交互
2024-04-16 v2 人工智能
摘要
设想一下,如果 AI 决策支持工具不仅能补充我们做出准确决策的能力,还能提升我们的技能、促进协作并增加我们从任务中获得的乐趣,那将如何?尽管有潜力优化如此广泛的一系列以人为本的目标,但当前 AI 工具的设计仍仅专注于决策准确性。我们提出离线强化学习 (RL) 作为一种通用方法,用于建模人机决策过程,以针对多样化目标优化人机交互。RL 可以通过定制决策支持,在正确的时间向正确的人提供正确类型的协助,从而优化此类目标。我们将该方法实例化为两个目标:决策任务中的人机准确性,以及人类对任务的学习,并从先前的人机交互数据中学习决策支持策略。我们将优化后的策略与 AI 辅助决策中的几种基线进行了比较。在两项实验(N=316 和 N=964)中,我们的结果表明,与使用任何其他类型 AI 支持的人相比,与针对准确性优化的策略交互的人在准确性方面取得了显著更好的表现,甚至实现了人机互补。我们的结果进一步表明,人类学习比准确性更难优化,与学习优化策略交互的参与者仅在特定时刻显示出显著的学习改进。我们的研究 (1) 证明了离线 RL 是建模人机决策的一种有前景的方法,能够产生可能优化以人为本目标的策略,并为 AI 辅助决策领域提供新颖见解;(2) 强调了在 AI 辅助决策中考虑除决策准确性之外的以人为本目标的重要性,开启了针对此类目标优化人机交互这一新的研究挑战。
引用
@article{arxiv.2403.05911,
title = {Towards Optimizing Human-Centric Objectives in AI-Assisted Decision-Making With Offline Reinforcement Learning},
author = {Zana Buçinca and Siddharth Swaroop and Amanda E. Paluch and Susan A. Murphy and Krzysztof Z. Gajos},
journal= {arXiv preprint arXiv:2403.05911},
year = {2024}
}