面向交互式对话搜索的临时 IR 数据集增强
信息检索
2023-11-13 v1
摘要
对话搜索系统的一个特点是其涉及混合主动交互,例如系统生成的查询澄清问题。在 IR 最终任务上大规模评估这些系统非常具有挑战性,需要包含此类交互的适当数据集。然而,当前数据集仅关注传统临时 IR 任务或查询澄清任务,后者通常被视为初始查询的重构任务。我们所知的仅有的两个同时包含文档相关性判断及关联澄清交互的数据集是 Qulac 与 ClariQ。二者均基于 TREC Web Track 2009-12 语料,但覆盖的主题数量极为有限(237 个主题),远不足以训练和测试对话 IR 模型。为填补空白,我们提出一种从临时 IR 数据集自动构建大规模对话 IR 数据集的方法,以促进对话 IR 的探索。我们的方法基于两个过程:1) 通过查询澄清与回答生成器生成查询澄清交互,2) 用模拟交互增强临时 IR 数据集。本文中,我们聚焦于 MsMarco 并用查询澄清与回答模拟对其增强。我们进行了详尽评估,展示了针对每个初始查询所生成交互的质量与相关性。本文显示了增强临时 IR 数据集用于对话 IR 的可行性与效用。
引用
@article{arxiv.2311.06119,
title = {Augmenting Ad-Hoc IR Dataset for Interactive Conversational Search},
author = {Pierre Erbacher and Jian-Yun Nie and Philippe Preux and Laure Soulier},
journal= {arXiv preprint arXiv:2311.06119},
year = {2023}
}