基于语料库信息的检索增强生成澄清问题
信息检索
2024-09-30 v1
摘要
本研究旨在开发为网络搜索生成基于语料库信息的澄清问题的模型,以确保问题与检索语料库中的可用信息保持一致。我们展示了检索增强语言模型 (RAG) 在此过程中的有效性,强调了其能力:(i) 联合建模用户查询和检索语料库以精准定位不确定性并端到端地请求澄清,以及 (ii) 建模更多证据文档,这可用于增加所提问题的广度。然而,我们观察到在当前数据集中,搜索意图很大程度上不受语料库支持,这对训练和评估都是有问题的。这导致问题生成模型产生“幻觉”,即建议语料库中不存在的意图,这会对性能产生不利影响。为了解决这个问题,我们提出了将真实值澄清与检索语料库相对齐的数据集增强方法。此外,我们探索了在推理过程中增强证据池相关性的技术,但发现在语料库中识别真实值意图仍然具有挑战性。我们的分析表明,这种挑战部分是由于当前数据集偏向于澄清分类法,并呼吁提供能够支持生成基于语料库信息的澄清的数据。
引用
@article{arxiv.2409.18575,
title = {Corpus-informed Retrieval Augmented Generation of Clarifying Questions},
author = {Antonios Minas Krasakis and Andrew Yates and Evangelos Kanoulas},
journal= {arXiv preprint arXiv:2409.18575},
year = {2024}
}