人类与 AI 交互中的隐形失效
计算与语言
2026-05-13 v2
摘要
AI 系统的静默失效频率远高于显式失效。我们分析了来自 WildChat 数据集中 10 万次人类-AI 交互,发现 79% 的 AI 失效是隐形的:出了问题但用户没有明确表明存在问题。这些隐形失效聚集为八种原型,有助于我们刻画 AI 系统未能满足用户需求的具体位置和方式。此外,这些原型显示出系统性的共现模式,指明了更高层次的失效类型。为探讨这些原型在 AI 系统日益强大后是否仍具相关性,我们还创建并标注了一个反事实数据集,其中将 WildChat 的 2024 版响应替换为来自三个当今主流大型语言模型的响应。该分析表明,尽管失效率大幅下降,但绝大多数失效仍是我们意义上的隐形失效,失效原型的分布似乎保持稳定。最后,我们通过实例说明,这些原型有助于识别不同使用领域中 AI 的系统性和可变限制。总体而言,我们认为,这种隐形失效分类法可作为可靠失效监控的关键组件,供产品开发者、科学家和政策制定者使用。我们的代码和数据已公开于 https://github.com/bigspinai/bigspin-invisible-failure-archetypes。
引用
@article{arxiv.2603.15423,
title = {Invisible failures in human-AI interactions},
author = {Christopher Potts and Moritz Sudhof},
journal= {arXiv preprint arXiv:2603.15423},
year = {2026}
}