重新思考语义相似度的众包标注
计算与语言
2021-09-27 v1 人工智能
人机交互
摘要
语义相似度的估计对多种自然语言处理(NLP)任务至关重要。在缺乏语义信息通用理论的情况下,许多论文依赖人类标注者作为语义相似度估计的基准真值来源。本文调查众包语义标注中固有的歧义。结果表明,将语义相似度视为二元类别(两个句子要么相似要么不相似,没有中间地带)的标注者在标注中起着最重要的作用。本文提供启发式方法来过滤不可靠的标注者,并激发关于人类对语义相似度感知的进一步讨论。
引用
@article{arxiv.2109.11969,
title = {Rethinking Crowd Sourcing for Semantic Similarity},
author = {Shaul Solomon and Adam Cohn and Hernan Rosenblum and Chezi Hershkovitz and Ivan P. Yamshchikov},
journal= {arXiv preprint arXiv:2109.11969},
year = {2021}
}