语义搜索中歧义性的拓扑量化
机器学习
2026-02-18 v2 人工智能
计算与语言
摘要
我们研究了局部拓扑结构如何编码句子嵌入中的歧义性。通过将词级多义性推广到非平凡持续同调,我们将这一概念推广到完整句子,并在语义搜索过程中用两个持续同调度量来量化查询的歧义性: 的 1-Wasserstein 范数和 的最大环寿命。我们将歧义性的概念形式化为句子中语义域或主题的相对存在度。随后,我们利用这一形式化方法进行“从头开始”的模拟,将数据点编码为任意嵌入空间中随机生成的单一主题向量的线性组合,并证明在两种度量下,歧义句均能与无歧义句区分开来。最后,我们通过对一个完全开放的语料库(包含 1901 年至 2024 年诺贝尔物理学奖演讲,按约 250 个词元和约 750 个词元两种粒度切分为连续不重叠的片段)进行案例研究,验证了上述发现。我们测试了四种公开可用的嵌入模型。所有模型的结果均重现了模拟结果,并且不随嵌入架构的变化而改变。我们得出结论,持续同调提供了一种与模型无关的语义不连续性信号,可用于歧义检测和语义搜索召回。
关键词
引用
@article{arxiv.2406.07990,
title = {Topological quantification of ambiguity in semantic search},
author = {Thomas Roland Barillot and Alex De Castro},
journal= {arXiv preprint arXiv:2406.07990},
year = {2026}
}