超越准确性:基于可解释性的有害内容检测分析
计算与语言
2026-03-20 v1 人工智能
摘要
尽管自动化有害内容检测系统常被用于监控在线平台,但管理员和最终用户经常无法理解其预测背后的逻辑。虽然近期研究聚焦于提高分类准确率,但很少关注如何理解神经模型为何将内容识别为有害的,尤其是在边缘、情境和政治敏感情形下。本文对在 Civil Comments 数据集上训练的神经有害内容检测模型进行可解释性驱动的分析。我们采用 Shapley 增益解释 和积分梯度 两种流行的事后解释方法,分析基于 RoBERTa 的分类器在正确预测和系统性失效案例中的行为。尽管整体性能优异(ROC-AUC 为 0.93,准确率为 0.94),但分析揭示了这些指标无法观察到的局限性。积分梯度提取更为分散的情境归因,而 Shapley 增益解释提取更聚焦的显性词汇线索。二者输出的差异在误报和漏报中均有体现。定性案例研究揭示了诸如间接有害、词汇过度归因或政治话语等反复出现的失效模式。结果表明,可解释 AI 可通过暴露模型不确定性并提高自动化决策的可解释性来促进人机协同监控。更重要的是,本工作凸显了可解释性作为在线有害内容检测系统透明性和诊断资源的作用,而非性能提升手段。
引用
@article{arxiv.2603.18015,
title = {Beyond Accuracy: An Explainability-Driven Analysis of Harmful Content Detection},
author = {Trishita Dhara and Siddhesh Sheth},
journal= {arXiv preprint arXiv:2603.18015},
year = {2026}
}
备注
This paper has been accepted at TrustNet 2026 (https://trustnetcon.in/). The final version will appear in Springer (LNNS), 2026