ChatQA 2:在长上下文和 RAG 能力上缩小与闭源 LLM 的差距
摘要
在这项工作中,我们介绍了 ChatQA 2,一个基于 Llama 3.0 的模型,具有 128K 上下文窗口,旨在缩小开源 LLM 与领先的闭源模型(例如 GPT-4-Turbo-2024-04-09)在长上下文理解和检索增强生成(retrieval-augmented generation, RAG)能力方面的差距。这两种能力相辅相成,对于 LLM 处理无法放入单个提示的大量信息至关重要。我们提出了一个详细的继续训练方案,将 Llama3-70B-base 的上下文窗口从 8K 扩展到 128K 个 token,并采用三阶段指令微调过程来增强模型的指令遵循、RAG 性能和长上下文理解能力。我们的结果表明,Llama3-ChatQA-2-70B 模型在超过 100K 个 token 的超长任务上,以及在使用仅 4K 上下文窗口的 RAG 基准测试中,优于大多数现有的最先进模型,包括 GPT-4-Turbo-2024-04-09、Qwen2-72B-Instruct 和 Llama3.1-70B-Instruct,展示了其在不同序列长度下的强大长上下文能力。我们进一步使用相同的最先进长上下文 LLM,对直接长上下文解决方案和 RAG 解决方案进行了广泛比较。有趣的是,我们发现强大的长上下文 LLM 在使用 RAG 时,检索更多文本块会提高性能。通过使用大量 top-k 块,RAG 在 32K 和 128K 基准测试上,始终优于使用相同最先进长上下文模型(例如 Llama3-ChatQA-2-70B 和 Qwen2-72B-Instruct)的直接长上下文解决方案。我们为社区开源了模型权重、训练数据和评估设置:https://chatqa2-project.github.io/
引用
@article{arxiv.2407.14482,
title = {ChatQA 2: Bridging the Gap to Proprietary LLMs in Long Context and RAG Capabilities},
author = {Peng Xu and Wei Ping and Xianchao Wu and Chejian Xu and Zihan Liu and Mohammad Shoeybi and Bryan Catanzaro},
journal= {arXiv preprint arXiv:2407.14482},
year = {2025}
}
备注
Accepted at ICLR 2025