多视图标识符增强的生成式检索
计算与语言
2023-05-29 v1 人工智能
信息检索
机器学习
摘要
生成式检索并非简单地将查询与已有段落进行匹配,而是将段落的标识符字符串作为检索目标进行生成。但代价是,标识符必须足够具有区分度以代表一个段落。现有方法使用数字 ID 或文本片段(如标题或子串)作为标识符。然而,这些标识符无法很好地覆盖段落内容。为此,我们提出一种新型标识符——合成标识符,它基于段落内容生成,并能整合文本片段所缺乏的上下文信息。此外,我们同时考虑多视图标识符,包括合成标识符、标题和子串。这些视图的标识符相互补充,有助于从多个角度对段落进行整体排序。我们在三个公开数据集上进行了一系列实验,结果表明我们提出的方法在生成式检索中表现最佳,证明了其有效性和鲁棒性。
引用
@article{arxiv.2305.16675,
title = {Multiview Identifiers Enhanced Generative Retrieval},
author = {Yongqi Li and Nan Yang and Liang Wang and Furu Wei and Wenjie Li},
journal= {arXiv preprint arXiv:2305.16675},
year = {2023}
}
备注
ACL 2023 Main Conference