中文

KunLunBaizeRAG:基于强化学习提升大语言模型推理性能的框架

人工智能 2025-06-30 v2

摘要

本文介绍KunLunBaizeRAG,一种基于强化学习驱动的推理框架,旨在增强大语言模型(LLM)在复杂多跳问答任务中的推理能力。该框架针对传统RAG方法的检索漂移、信息冗余和策略僵化等关键局限性进行了创新设计。核心创新包括RAG驱动的推理对齐机制(RDRA)、搜索-思考迭代增强机制(STIE)、网络局部智能路由机制(NLR)以及渐进式混合训练策略。实验结果在四个基准测试中显示出对精确匹配率(EM)和LLM评估得分(LJ)的显著提升,凸显该框架在复杂推理场景中的鲁棒性与有效性。

关键词

引用

@article{arxiv.2506.19466,
  title  = {KunLunBaizeRAG: Reinforcement Learning Driven Inference Performance Leap for Large Language Models},
  author = {Cheng Li and Jiexiong Liu and Yixuan Chen and Qihang Zhou and KunLun Meta},
  journal= {arXiv preprint arXiv:2506.19466},
  year   = {2025}
}