中文

评估AI赋能决策支持系统的可信度:多源AI记分卡表(MAST)的验证

计算机与社会 2023-12-01 v1

摘要

多源AI记分卡表(MAST)是一种基于分析技艺标准的清单工具,用于指导可信AI系统的设计与评估。在本研究中,我们评估MAST是否与人们对AI赋能决策支持系统(AI-DSSs)的信任感知相关。评估AI-DSSs中的信任对研究人员和实践者提出了挑战。这些挑战包括识别这些系统的组件、能力和潜力,其中许多基于驱动DSS性能且无法完全人工检查的复杂深度学习算法。我们使用MAST标准开发了两种交互式AI-DSS测试环境。一种模拟安全筛查中的身份核验任务,另一种模拟用于辅助调查报道任务的文本摘要系统。每个测试环境有一个匹配低MAST评级的版本,另一个匹配高MAST评级的版本,假设MAST评级与这些系统的信任评级呈正相关。共招募177名领域专家与这些系统交互并评估它们。结果普遍显示高MAST条件下MAST评级高于低MAST组,且信任感知度量与MAST评级高度相关。我们得出结论,MAST可成为设计和评估能引发高信任感知系统的有用工具,包括可能用于支持视觉筛查和文本摘要任务的AI-DSS。然而,更高的MAST评级未必转化为更高的联合性能。

关键词

引用

@article{arxiv.2311.18040,
  title  = {Evaluating Trustworthiness of AI-Enabled Decision Support Systems: Validation of the Multisource AI Scorecard Table (MAST)},
  author = {Pouria Salehi and Yang Ba and Nayoung Kim and Ahmadreza Mosallanezhad and Anna Pan and Myke C. Cohen and Yixuan Wang and Jieqiong Zhao and Shawaiz Bhatti and James Sung and Erik Blasch and Michelle V. Mancenido and Erin K. Chiou},
  journal= {arXiv preprint arXiv:2311.18040},
  year   = {2023}
}