中文

Magnitude Matters:面向整体语义理解的优越相似度度量

计算与语言 2025-09-25 v1 人工智能

摘要

高维向量比较是 NLP 中的基本任务,但目前仅以两种基准主导:原始点积——无界且敏感于向量范数;以及余弦相似度——完全丢弃了幅度信息。本文挑战这两种标准,提出并严格评估了一类无参数、幅度感知的相似度度量。我引入两种此类函数:重叠相似度(Overlap Similarity, OS)和双曲正切相似度(Hyperbolic Tangent Similarity, HTS),旨在以更原则的方式整合向量幅度与对齐信息。为确保发现具有鲁棒性和可泛化性,我使用四种最新句子嵌入模型(all-MiniLM-L6-v2、all-mpnet-base-v2、paraphrase-mpnet-base-v2 和 BAAI/bge-large-en-v1.5)进行了全面评估,涵盖八个标准 NLP 基准,包括 STS-B、SICK、Quora 和 PAWS。采用 Wilcoxon 符号秩检验检验统计显著性,我的结果具有决定性:在需要整体语义理解的任务(如改写和推理)上,OS 和 HTS 在所有底层嵌入模型下,均对原始点积和余弦相似度在均方误差上实现统计显著提升。关键在于,我的发现界定了这些度量优势的具体领域:对于需要整体语义理解的任务(如改写和推理),我的幅度感知度量提供了统计上优越的替代方案。这种显著提升在旨在测试高度细致构成语义的基准(SICK、STS-B)上并未观察到,将构成表示构成文本的独立且重要的未来工作方向。

关键词

引用

@article{arxiv.2509.19323,
  title  = {Magnitude Matters: a Superior Class of Similarity Metrics for Holistic Semantic Understanding},
  author = {V. S. Raghu Parupudi},
  journal= {arXiv preprint arXiv:2509.19323},
  year   = {2025}
}

备注

submitted to AAAI 2026