中文

捕捉标签分布:以自然语言推理为例

计算与语言 2021-02-16 v1

摘要

我们研究在自然语言推理任务中估计内在人类标注分歧(标注标签分布)的问题。将预测标签分布进行事后平滑以匹配期望标签熵非常有效。这种简单的操作可将KL散度降低近一半,却不会提升多数标签预测准确率或学习到标签分布。为此,我们在训练中引入少量含多个参考标注的样本。我们偏离了每个训练样本仅收集单一参考标注的常规做法,发现固定标注预算下收集多个参考标注能取得更好的准确率。最后,我们提供了丰富分析,比较这两种改进标签分布估计的方法。

关键词

引用

@article{arxiv.2102.06859,
  title  = {Capturing Label Distribution: A Case Study in NLI},
  author = {Shujian Zhang and Chengyue Gong and Eunsol Choi},
  journal= {arXiv preprint arXiv:2102.06859},
  year   = {2021}
}