ChatQA:在对话式问答与RAG上超越GPT-4
计算与语言
2024-10-31 v5 人工智能
信息检索
机器学习
摘要
在本工作中,我们提出了ChatQA,这是一系列在检索增强生成(RAG)和对话式问答(QA)上超越GPT-4的模型。为了增强生成能力,我们提出了一种两阶段指令微调方法,显著提升了RAG的性能。为了实现有效检索,我们引入了一种针对对话式QA优化的密集检索器,其结果可媲美替代的SOTA查询重写模型,同时大幅降低了部署成本。我们还提出了ChatRAG基准,包含十个数据集,涵盖对RAG、表格相关QA、算术计算以及涉及无法回答问题的场景的综合评估。我们的ChatQA-1.0-70B(得分:54.14)构建于Llama2之上(一个比GPT-4弱的基础模型),在不依赖任何来自OpenAI GPT模型的合成数据的情况下,在ChatRAG基准上略微优于GPT-4-0613(得分:53.90)和GPT-4-Turbo-2024-04-09(得分:54.03)。值得注意的是,Llama3-ChatQA-1.5-70B模型超越了GPT-4-Turbo-2024-04-09的准确率,实现了4.4%的提升。为了推进该领域的研究,我们向社区开源了模型权重、指令微调数据、ChatRAG基准和检索器:https://chatqa-project.github.io/。
引用
@article{arxiv.2401.10225,
title = {ChatQA: Surpassing GPT-4 on Conversational QA and RAG},
author = {Zihan Liu and Wei Ping and Rajarshi Roy and Peng Xu and Chankyu Lee and Mohammad Shoeybi and Bryan Catanzaro},
journal= {arXiv preprint arXiv:2401.10225},
year = {2024}
}
备注
Accepted at NeurIPS 2024