面向 Web 增强长篇问答的事实性优化检索增强生成
计算与语言
2024-07-02 v1
摘要
检索增强生成(RAG)因其能够利用搜索引擎增强长篇问答(LFQA)质量而在问答任务中变得流行。尽管各种开源方法和基于 Web 的商业系统(如 Bing Chat)涌现,但仍存在事实性不足且生成答案逻辑不清晰的关键问题。本文通过系统性研究 Web 增强 LFQA 中的答案生成,来解决这些问题。具体而言,我们首先提出一种基于细化轮廓的生成器,以实现多层次答案生成中的清晰逻辑,并据此构建了两个数据集。随后,我们提出一种基于精心设计的双细粒度 RLHF 框架的方法,以实现事实性优化,框架中包含不同粒度水平的自动评估和奖励建模。我们的通用框架将常规细粒度 RLHF 方法视为特例。广泛的实验验证了我们提出的事实性优化 RAG(FoRAG)方法在英语和中文基准测试中的优越性。特别是,当将我们的方法应用于 Llama2-7B-chat 时,派生模型 FoRAG-L-7B 在三个常用指标(即连贯性、有用性和事实性)上超越 WebGPT-175B,而参数数量却大大减少(仅为 WebGPT-175B 的 1/24)。我们的数据集和模型已公开发布以提高可重复性:https://huggingface.co/forag。
引用
@article{arxiv.2406.13779,
title = {FoRAG: Factuality-optimized Retrieval Augmented Generation for Web-enhanced Long-form Question Answering},
author = {Tianchi Cai and Zhiwen Tan and Xierui Song and Tao Sun and Jiyan Jiang and Yunqi Xu and Yinger Zhang and Jinjie Gu},
journal= {arXiv preprint arXiv:2406.13779},
year = {2024}
}