基于检索增强生成的偏好学习用于对话式问答
计算与语言
2025-04-16 v2 信息检索
摘要
对话式问答(ConvQA)涉及多个子任务:i) 在上下文中理解不完整的问题,ii) 检索相关信息,iii) 生成答案。本文提出了 PRAISE 方法,采用基于管道的方案为 ConvQA 中的这三个子任务训练 LLM 适配器。由于在实际情况下无法获得各子任务的标注训练数据,PRAISE 通过利用最终问答性能作为反馈信号,从自身生成的内容中进行学习,并将中间信息(如相关证据)视为弱标注数据。我们应用直接偏好优化(Direct Preference Optimization)对每个子任务进行成功样本与不成功样本的对比。在实验中,我们展示了这一训练范式的有效性:PRAISE 在各子任务上均实现了改进,并在流行的 ConvQA 基准上取得了新的状态-of-the-art 性能,准确率提升了 15.5 个百分点。
引用
@article{arxiv.2503.22303,
title = {Preference-based Learning with Retrieval Augmented Generation for Conversational Question Answering},
author = {Magdalena Kaiser and Gerhard Weikum},
journal= {arXiv preprint arXiv:2503.22303},
year = {2025}
}
备注
WWW 2025 Short Paper, 5 pages