Magnitude Matters:面向整体语义理解的优越相似度度量
计算与语言
2025-09-25 v1 人工智能
摘要
高维向量比较是 NLP 中的基本任务,但目前仅以两种基准主导:原始点积——无界且敏感于向量范数;以及余弦相似度——完全丢弃了幅度信息。本文挑战这两种标准,提出并严格评估了一类无参数、幅度感知的相似度度量。我引入两种此类函数:重叠相似度(Overlap Similarity, OS)和双曲正切相似度(Hyperbolic Tangent Similarity, HTS),旨在以更原则的方式整合向量幅度与对齐信息。为确保发现具有鲁棒性和可泛化性,我使用四种最新句子嵌入模型(all-MiniLM-L6-v2、all-mpnet-base-v2、paraphrase-mpnet-base-v2 和 BAAI/bge-large-en-v1.5)进行了全面评估,涵盖八个标准 NLP 基准,包括 STS-B、SICK、Quora 和 PAWS。采用 Wilcoxon 符号秩检验检验统计显著性,我的结果具有决定性:在需要整体语义理解的任务(如改写和推理)上,OS 和 HTS 在所有底层嵌入模型下,均对原始点积和余弦相似度在均方误差上实现统计显著提升。关键在于,我的发现界定了这些度量优势的具体领域:对于需要整体语义理解的任务(如改写和推理),我的幅度感知度量提供了统计上优越的替代方案。这种显著提升在旨在测试高度细致构成语义的基准(SICK、STS-B)上并未观察到,将构成表示构成文本的独立且重要的未来工作方向。
引用
@article{arxiv.2509.19323,
title = {Magnitude Matters: a Superior Class of Similarity Metrics for Holistic Semantic Understanding},
author = {V. S. Raghu Parupudi},
journal= {arXiv preprint arXiv:2509.19323},
year = {2025}
}
备注
submitted to AAAI 2026