人类如何评估自动列车运行中用于人检测的 AI 系统:并非所有失误都一样
人机交互
2025-04-04 v1
摘要
如果人工智能(AI)要应用于安全关键领域,其性能需要被可靠地评估。本研究旨在理解人类如何评估自动列车运行中用于人检测的 AI 系统。在三个实验中,参与者看到铁路轨道附近行人的图像序列。模拟 AI 标记了所有检测到的人,有的正确,有的错误。参与者需要提供 AI 性能的评分,并用言语解释自己的评分。实验变化了可能影响人类评分的多个因素:AI 错误的类型和可信度、受影响图像的数量、图像中人的数量、与轨道相关的人的位置,以及用于引导人类评估的方法。尽管所有这些因素都影响了人类评分,但一些效果是意外的或偏离了规范标准。例如,影响力最大的因素是人们相对于轨道的位置,尽管参与者明确被指示 AI 不能处理此类信息。总体而言,结果表明人类有时会评估超过 AI 在指定任务上的表现。AI 能力与人类期望之间的此类不匹配应在对 AI 系统进行安全审计时考虑在内。
引用
@article{arxiv.2504.02664,
title = {How humans evaluate AI systems for person detection in automatic train operation: Not all misses are alike},
author = {Romy Müller},
journal= {arXiv preprint arXiv:2504.02664},
year = {2025}
}