中文

超越余弦相似度:在1500万节点土耳其语同义词图中驯服语义漂移和反义词入侵

计算与语言 2026-01-21 v1 机器学习

摘要

神经嵌入有一个臭名昭著的盲点:它们无法可靠地区分同义词和反义词。因此,提高相似度阈值通常无法阻止反义词被归为一类。我们构建了一个专门为正面解决这个问题而设计的大规模语义聚类系统。我们的流程处理了1500万个词汇项,评估了5.2亿个潜在关系,并最终生成了290万个高精度语义簇。该系统做出了三项主要贡献。首先,我们引入了一个包含84.3万个概念对的标记数据集,涵盖同义、反义和并列下义关系,通过Gemini 2.5-Flash LLM增强构建,并使用人工策划的词典资源进行验证。其次,我们提出了一个专门的三路语义关系判别器,达到了90%的宏F1分数,使得能够超越原始嵌入相似度进行鲁棒消歧。第三,我们引入了一种新颖的软到硬聚类算法,该算法减轻了语义漂移,防止了错误的传递链(例如,热 -> 辣 -> 痛 -> 抑郁),同时解决了多义词问题。我们的方法采用了一种拓扑感知的两阶段扩展-剪枝过程,并带有拓扑投票,确保每个术语被分配到一个且仅一个语义连贯的簇中。由此产生的资源能够实现高精度语义搜索和检索增强生成,特别是对于形态丰富和低资源语言,这些语言的现有同义词数据库仍然稀疏。

关键词

引用

@article{arxiv.2601.13251,
  title  = {Beyond Cosine Similarity: Taming Semantic Drift and Antonym Intrusion in a 15-Million Node Turkish Synonym Graph},
  author = {Ebubekir Tosun and Mehmet Emin Buldur and Özay Ezerceli and Mahmoud ElHussieni},
  journal= {arXiv preprint arXiv:2601.13251},
  year   = {2026}
}