如何衡量人类-AI 在可解释 AI 系统中的预测准确性
人机交互
2024-09-04 v1 人工智能
摘要
在评估 AI 系统行为时——尤其是在可解释 AI 系统中——有时会通过衡量人们预测代理下一步动作的能力来进行实证测量,但如何执行此类测量?在人类实验中,一种显而易见的方法是将任务表述为二元(即预测要么正确,要么错误),但这无法扩展。随着输出空间的增加,错误答案与正确答案的比例迅速变得非常小,从而导致 floor effects。问题的核心在于,二元表述未能捕捉不同程度“错误”的细微差别。为了解决这一问题,我们提出了三个数学基础来衡量“部分错误”。随后,我们利用这些基础对顺序决策领域进行两种分析:第一种是对 86 名参与者的实验室研究,使用 36 种动作空间;第二种是对先前研究进行再分析,使用 4 种动作空间。采用我们对预测任务和分析方法论方法化的其他研究人员将提高使用该任务进行的用户研究的严谨性,这在输出空间大的领域尤为重要。
引用
@article{arxiv.2409.00069,
title = {How to Measure Human-AI Prediction Accuracy in Explainable AI Systems},
author = {Sujay Koujalgi and Andrew Anderson and Iyadunni Adenuga and Shikha Soneji and Rupika Dikkala and Teresita Guzman Nader and Leo Soccio and Sourav Panda and Rupak Kumar Das and Margaret Burnett and Jonathan Dodge},
journal= {arXiv preprint arXiv:2409.00069},
year = {2024}
}