中文

对话金: 使用金矿评估个性化对话搜索系统

信息检索 2025-03-14 v1

摘要

大语言模型(LLM)的进步推动了个性化对话搜索系统的兴起,使其能够检索和生成以复杂信息需求为导向的答案。然而,针对检索增强生成(RAG)系统生成响应的自动评估仍是一个较少研究的挑战。本文引入了一种新的资源,用于评估 RAG 系统生成响应的检索有效性和相关性,采用基于矿石的评估框架。该数据集建立在 TREC iKAT 2023 的基础上,扩展至 TREC iKAT 2024 集合,包括17次对话和20,575条相关段落评估,以及2,279个提取的金矿和62个由 NIST 评估员手工编写的金标准答案。虽然保持了其前任的核心结构,本新集合仍然使我们能够更深入地探索对话环境中的生成任务。iKAT 2024 的关键改进包括:(1)“金矿”——从相关段落中提取的简洁、必需信息片段,作为自动响应评估的基础;(2)手工编写的答案,为响应评估提供金标准;(3)不可回答问题,用于评估模型幻觉;(4)扩展的用户角色,提供更丰富的情境依据;(5)从个人文本知识库(PTKB)排序转变为 PTKB 分类和选择。基于该资源,我们提供了一个用于长篇答案生成评估的框架,涉及矿石提取和矿石匹配,与检索相关联。这为推动个性化对话搜索和长篇答案生成研究奠定了坚实的资源基础。我们的资源已公开于 https://github.com/irlabamsterdam/CONE-RAG。

关键词

引用

@article{arxiv.2503.09902,
  title  = {Conversational Gold: Evaluating Personalized Conversational Search System using Gold Nuggets},
  author = {Zahra Abbasiantaeb and Simon Lupart and Leif Azzopardi and Jeffery Dalton and Mohammad Aliannejadi},
  journal= {arXiv preprint arXiv:2503.09902},
  year   = {2025}
}