区域拼写惯例对检索模型的影响
信息检索
2023-08-02 v1
摘要
神经排序模型的一个优势在于其旨在同义情况下(即两个词具有相似或相同含义)良好地泛化。在本文中,我们研究并量化了各种排序模型在一类明确的同义情形下的表现:当词语仅因区域拼写惯例差异而呈现不同表面形式时(例如 color 与 colour)。我们首先探讨了用于神经检索方法预训练、训练和评估的数据集中美式与英式英语拼写惯例的普遍程度,发现美式拼写惯例远为普遍。尽管训练数据存在这些偏差,我们发现检索模型在此同义情形下通常能良好泛化。我们探究了文档拼写归一化在检索中的影响,观察到所有模型都受到文档拼写归一化的影响。当归一化为与查询不同的拼写惯例时,它们均出现性能下降;而当文档被归一化为与查询相同的拼写惯例时,我们观察到不同行为:词法模型表现提升,稠密检索器不受影响,重排序器则表现出矛盾行为。
引用
@article{arxiv.2308.00480,
title = {On the Effects of Regional Spelling Conventions in Retrieval Models},
author = {Andreas Chari and Sean MacAvaney and Iadh Ounis},
journal= {arXiv preprint arXiv:2308.00480},
year = {2023}
}
备注
10 pages, 3 tables, short paper published in SIGIR '23