中文

提升对话式搜索测试集合的可复用性

信息检索 2025-03-14 v1

摘要

不完整的相关性判断限制了测试集合的可复用性。当新系统与池中先前贡献的系统进行比较时,它们往往处于劣势。这是由于测试集合中未判断文档的口袋(称为空洞)被新系统返回。对话式搜索(CS)的本质意味着在评估系统时这些空洞可能更大且更具问题性。在本文中,我们旨在通过利用现有判断,使用大语言模型(LLM)来填补空洞。我们使用 TREC iKAT 23 和 TREC CAsT 22 集合探索此问题,其中信息需求高度动态且响应更加多样,留出更大的空洞需要填补。我们的实验揭示 CS 集合在更深轮次中呈现出可复用性降低的趋势。此外,微调 Llama 3.1 模型与人类评估者达成高度一致,而少样本提示 ChatGPT 则与人类的一致性较低。因此,使用 ChatGPT 填补新系统的空洞会导致新系统排名的更大变化。虽然使用少样本提示 ChatGPT 模型重新生成评估池并用于评估可以实现与人类评估池的高秩相关性。我们证明使用 Llama 3.1 模型的少样本训练来填补空洞可以在新系统与池中贡献系统之间实现更公平的比较。我们基于 Llama 3.1 模型少样本训练的填补空洞模型可以提升测试集合的可复用性。

关键词

引用

@article{arxiv.2503.09899,
  title  = {Improving the Reusability of Conversational Search Test Collections},
  author = {Zahra Abbasiantaeb and Chuan Meng and Leif Azzopardi and Mohammad Aliannejadi},
  journal= {arXiv preprint arXiv:2503.09899},
  year   = {2025}
}

备注

arXiv admin note: text overlap with arXiv:2405.05600