准确性不等于一致性:基于专家对齐的崩溃叙事分类模型评估
计算与语言
2025-09-30 v2 人工智能
摘要
本研究探讨了深度学习 (DL) 模型准确性与专家一致性在对崩溃叙事分类方面的关系。我们对五个 DL 模型——包括 BERT 变体、USE 和零样本分类器——进行评估,分别对照专家标签和叙事,并扩展分析四个大型语言模型 (LLM):GPT-4、LLaMA 3、Qwen 和 Claude。我们的发现表明,两种情况呈反相关:技术准确性更高的模型往往与人类专家的一致性更低,而 LLM 表现出更强的专家对齐,尽管准确性较低。我们使用 Cohen's Kappa 和主成分分析 (PCA) 来量化和可视化模型与专家之间的一致性,并采用 SHAP 分析解释误分类。结果表明,专家对齐的模型更依赖上下文和时间线索,而非位置特定关键词。这些发现表明,准确性alone 不足以满足安全关键的 NLP 任务。我们主张将专家一致性纳入模型评估框架,并强调 LLM 作为解释性工具在崩溃分析管道中的潜在价值。
引用
@article{arxiv.2504.13068,
title = {Accuracy is Not Agreement: Expert-Aligned Evaluation of Crash Narrative Classification Models},
author = {Sudesh Ramesh Bhagat and Ibne Farabi Shihab and Anuj Sharma},
journal= {arXiv preprint arXiv:2504.13068},
year = {2025}
}