中文

基于价值感知干预提升人类表现:国际象棋案例研究

人工智能 2026-04-17 v1

摘要

AI 系统越来越多地用于协助人类完成序列决策任务,但确定 AI 助手何时以及如何干预仍是一个根本性挑战。一种可能的基准是根据强大模型推荐最优动作。然而,这些动作假设后续跟随动作为最优,而人类决策者可能无法执行,从而可能降低整体绩效。在本工作中,我们提出并研究了基于价值的干预方案,灵感来自强化学习中的一个基本原则:在贝尔曼方程下,最优政策选择能最大化即时奖励加上价值函数的动作。当决策者遵循次优政策时,这一政策-价值一致性不再成立,在动作选择上产生差异。我们表明,这些政策-价值不一致自然地识别出干预的机会。我们在马尔可夫决策过程中对该问题进行形式化化,其中 AI 助手可在干预预算下覆盖人类动作。在单次干预情形下,我们证明最优策略是推荐最大化人类价值函数的动作。对于多次干预的情形,我们提出了一种可行的近似方法,基于政策-价值差异的大小对干预进行优先排序。在棋局域中,我们通过学习大规模游戏数据的模型来评估这些想法。在仿真实验中,我们的方法在各种情形下均 consistently 优于基于最强国际象棋引擎(Stockfish)的干预。进一步的对内人类研究包含 20 名选手和 600 场比赛,结果表明我们的干预在提升低和中水平选手绩效方面显著有效,而对高水平选手的干预效果与专家级引擎干预相当。

关键词

引用

@article{arxiv.2604.14465,
  title  = {Improving Human Performance with Value-Aware Interventions: A Case Study in Chess},
  author = {Saumik Narayanan and Raja Panjwani and Siddhartha Sen and Chien-Ju Ho},
  journal= {arXiv preprint arXiv:2604.14465},
  year   = {2026}
}