超越黑箱标签:诊断主观性NLP任务的可解释标准
计算与语言
2026-05-01 v2 人工智能
摘要
主观性NLP数据集通常将标注员判断聚合为单个黄金标签,难以诊断争议是源于模糊标准、分类边界的坍塌,还是合法的多样性。我们提出了一种模式层面的诊断方法,用于审计专家设计的标注方案,仅凭多标注员标准判断即可在黄金标签提交之前进行诊断。该诊断方法分离了两种失效模式:标准不稳定且难以操作化边界,以及系统性重叠导致互斥类别边界模糊。应用于商业文件中的说服价值提取,我们发现争议并非分散:不稳定性集中在少数标准上,而近一半受覆盖句子激活多个类别。这些信号与领域专家的争议位置一致,为紧密规范、修订类别结构或重新考虑标注范式提供了基于证据的审计。
引用
@article{arxiv.2604.17022,
title = {Beyond Black-Box Labels: Interpretable Criteria for Diagnosing Subjective NLP Tasks},
author = {Nisrine Rair and Alban Goupil and Valeriu Vrabie and Emmanuel Chochoy},
journal= {arXiv preprint arXiv:2604.17022},
year = {2026}
}
备注
Accepted to ACL Findings 2026