中文

小规模变换暴露语义相似性度量方法的弱点

计算与语言 2025-09-15 v1 人工智能

摘要

本研究考察了不同方法衡量语义相似性的效果,这在诸多软件工程应用中至关重要,如代码搜索、API 推荐、自动化代码审查和重构工具等。虽然大型语言模型日益被用于这些相似性评估,但关于它们是否真正理解语义关系或仅识别表面模式的疑问仍存。该研究测试了 18 种不同的相似性度量方法,包括基于词汇的方法、嵌入技术、LLM 基于系统以及结构感知算法。研究人员构建了一个系统化的测试框架,通过对文本和代码施加受控变换来评估各方法处理不同类型语义关系的能力。结果揭示了常用指标存在显著问题:某些嵌入方法在将语义相反的内容误判为相似时,错误率可达99.9%;而某些基于转换器的方法则偶尔将相反含义的内容评估为高于同义词的相似度。研究发现,嵌入方法的性能差往往源于其距离计算方式;将欧几里得距离改为余弦相似度可使结果提升24%至66%。基于 LLM 的方法在区分语义差异方面表现更佳,产生的相似度分数(0.00至0.29)显著低于嵌入方法(0.82至0.99),后者将不相似的内容错误地赋予高分。

关键词

引用

@article{arxiv.2509.09714,
  title  = {How Small Transformation Expose the Weakness of Semantic Similarity Measures},
  author = {Serge Lionel Nikiema and Albérick Euraste Djire and Abdoul Aziz Bonkoungou and Micheline Bénédicte Moumoula and Jordan Samhi and Abdoul Kader Kabore and Jacques Klein and Tegawendé F. Bissyande},
  journal= {arXiv preprint arXiv:2509.09714},
  year   = {2025}
}