中文

语义文本相似度中的人类集体意见

计算与语言 2023-08-09 v1

摘要

尽管语义文本相似度(STS)具有主观性且 STS 标注中普遍存在分歧,现有基准仍使用平均人类评分作为金标准。平均化掩盖了低一致性样本上人类意见的真实分布,并阻碍模型捕捉个体评分所代表的语义模糊性。本工作中,我们引入 USTS,首个具有不确定性感知的 STS 数据集,包含约 15,000 个中文句对与 150,000 个标签,以研究 STS 中的人类集体意见。分析表明,标量或单一高斯均不能充分拟合一组观测判断。我们进一步展示,当前 STS 模型无法捕捉由个体样本上人类分歧引起的方差,而是反映了对聚合数据集的预测置信度。

关键词

引用

@article{arxiv.2308.04114,
  title  = {Collective Human Opinions in Semantic Textual Similarity},
  author = {Yuxia Wang and Shimin Tao and Ning Xie and Hao Yang and Timothy Baldwin and Karin Verspoor},
  journal= {arXiv preprint arXiv:2308.04114},
  year   = {2023}
}

备注

16 pages, 7 figures