中文

面向人机对齐的AI辅助决策校准

机器学习 2024-02-26 v4 计算机与社会 人机交互 机器学习

摘要

每当二分类器被用于提供决策支持时,其通常同时给出标签预测与置信值。随后,决策者应使用该置信值来校准对预测的信任程度。在此背景下,常有人认为置信值应对应于预测标签与真实标签相符概率的良校准估计。然而,多条经验证据表明,决策者难以利用这些置信值建立何时该信任预测的良好直觉。本文中,我们的目标首先是理解原因,继而探究如何构建更有用的置信值。我们首先论证,对一类宽泛的效用函数,存在这样的数据分布:一般而言理性决策者不太可能利用上述置信值发现最优决策策略——最优决策者有时需要对较低(较高)置信值的预测放置更多(更少)信任。但我们随后表明,若置信值相对于决策者自身预测的置信满足自然对齐性质,则总存在最优决策策略,使决策者所需放置的信任程度对置信值单调,从而便于发现。进一步,我们表明相对于决策者自身预测置信的多重校准是对齐的充分条件。在四个不同AI辅助决策任务(分类器为真实人类专家提供决策支持)上的实验验证了我们的理论结果,并提示对齐或可带来更好决策。

关键词

引用

@article{arxiv.2306.00074,
  title  = {Human-Aligned Calibration for AI-Assisted Decision Making},
  author = {Nina L. Corvelo Benz and Manuel Gomez Rodriguez},
  journal= {arXiv preprint arXiv:2306.00074},
  year   = {2024}
}