中文

重新思考词语相似度:通过分类混淆度衡量语义相似性

计算与语言 2025-02-11 v1 人工智能

摘要

词语相似度在社会科学和文化分析任务中具有许多应用,如衡量随时间变化的意义以及理解争议性术语。然而,基于词嵌入之间余弦相似度的传统相似度方法无法捕捉语义相似性的语境依赖性、非对称性和多义性。我们提出了一种新的相似度度量——词语混淆(Word Confusion),将语义相似性重新框定为基于特征的分类混淆。词语混淆灵感来自Tversky建议动态选择相似性特征的观点。我们训练一个分类器将语境嵌入映射到词语身份,并使用分类混淆(即选择混淆词c而非正确目标词t的概率)作为c和t的相似度度量。潜在混淆词的集合作为所选特征。我们的方法在多个数据集(MEN、WirdSim353和SimLex)上与余弦相似度相当,能够匹配人类相似度判断,并且可以使用特定的特征来衡量相似度。我们演示了模型能够利用动态特征的能力,通过测试18世纪法语词语"revolution"从普遍的行动转向国家行动的意义变化这一假设。我们希望这次对语义相似性的重新构想将激发开发新的工具,以更好地捕捉语言的多面性和动态性,推动计算社会科学和文化分析等领域的发展。

关键词

引用

@article{arxiv.2502.05704,
  title  = {Rethinking Word Similarity: Semantic Similarity through Classification Confusion},
  author = {Kaitlyn Zhou and Haishan Gao and Sarah Chen and Dan Edelstein and Dan Jurafsky and Chen Shani},
  journal= {arXiv preprint arXiv:2502.05704},
  year   = {2025}
}

备注

Accepted to NAACL-main-2025