评估词嵌入对实际信息检索中相似度评分的影响
信息检索
2026-02-06 v1 人工智能
摘要
用户往往以语义为基础进行信息检索,搜索行为由同义词和多义性特征控制。语义表示策略代表了一种向更丰富关联连接的发展,这些关联连接能够充分捕捉这种复杂的语言用法。向量空间模型(Vector Space Modeling,简称 VSM)和神经词嵌入在现代机器学习和自然语言处理(Natural Language Processing,简称 NLP)管道中发挥着关键作用。嵌入利用分布式语义将单词、句子、段落或整个文档表示为高维空间中的向量。这可以被信息检索(Information Retrieval,简称 IR)系统利用,以在查询与答案之间利用语义关联性。本文评估了一种测量查询语句相似度的替代方法,这种方法远离神经词嵌入质心的常用相似度度量。受 Word Movers Distance(WMD)模型的启发,相似度通过查询与语句中 individual words 之间的距离来评估。来自有排序查询和响应语句的结果表明,使用结合 WMD 与词嵌入技术的相似度排序方法在准确性上显著提升。表现最佳的 WMD + GloVe 组合超越了所有其他最先进的检索模型,包括 Doc2Vec 和基准 LSA 模型。除了 WMD 在相似度排序方面的显著性能提外,我们得出结论,使用在大规模数据上训练的预训练词嵌入,结果产生一种对领域不敏感的语言处理解决方案,可移植到多样化的商业应用场景。
引用
@article{arxiv.2602.05734,
title = {Evaluating the impact of word embeddings on similarity scoring in practical information retrieval},
author = {Niall McCarroll and Kevin Curran and Eugene McNamee and Angela Clist and Andrew Brammer},
journal= {arXiv preprint arXiv:2602.05734},
year = {2026}
}