超越共识:NLP 中注释者不一致的观点建模与评估
计算与语言
2026-01-21 v2
摘要
注释者不一致在 NLP 中广泛存在,尤其是针对如有毒性检测和立场分析等主观且模糊的任务。虽然早期方法将不一致视为需消除的噪声,但近期研究越来越将其建模为反映解释和视角差异的有意义信号。本综述提供了不一致感知 NLP 方法的统一视图。我们首先给出一种域无关的分类法,概述了跨数据、任务和注释者因素的不一致来源。随后我们提出一种通用框架,将建模方法按预测目标和池化结构进行归类,突出从共识学习向显式建模不一致转变,以及向捕获注释者间结构性关系转变的趋势。我们综述了用于预测性能和注释者行为的评估指标,指出大多数公平性评估仍停留在描述性而非规范性层面。我们最后指出了开放挑战和未来方向,包括整合多源变异、开发不一致感知的可解释性框架,以及应对观点建模的实际权衡。
引用
@article{arxiv.2601.09065,
title = {Beyond Consensus: Perspectivist Modeling and Evaluation of Annotator Disagreement in NLP},
author = {Yinuo Xu and David Jurgens},
journal= {arXiv preprint arXiv:2601.09065},
year = {2026}
}