中文

基于标签分布的标注饱和度:学习标签分布的度量依赖性

计算与语言 2026-05-29 v1

摘要

当标注员对标签有分歧时,这种分歧本身就携带了信号——而捕捉这种信号所需的标注员数量取决于评估度量。我们在从ChaosNLI中抽样得到的标签分布上微调NLI模型,发现存在度量依赖的饱和现象。在3类NLI设置下,熵相关性——即模型识别哪些项目引发分歧——需要约N=20-50个标注员才能收敛,而分布匹配(KL散度)在N≈10时即可饱和(87-95%的改进跨越五个模型随机种子)。这一发现基于一个先行观察:软标签携带项目特定的信号,标签平滑无法复制。跨越五种平滑强度,熵相关性在r≈0.45-0.49之间聚类,而软标签达到r=0.643(p<0.001);按项目分析揭示了这一差距源于平滑无法区分模糊项目和明确项目。软标签优势在两种架构(DeBERTa、RoBERTa)、非NLI预训练基线以及探索性跨域内容安全评估中均得到复制。这些结果表明,标注预算应依据目标评估度量而非统一设置。

关键词

引用

@article{arxiv.2605.29797,
  title  = {Metric-Dependent Annotation Saturation for Learning from Label Distributions},
  author = {Guneet Kohli},
  journal= {arXiv preprint arXiv:2605.29797},
  year   = {2026}
}

备注

16 pages, 3 figures, 14 tables