中文

群体智慧:基于协同进化集体反馈的强化学习

人工智能 2025-08-19 v1

摘要

强化学习 (RL) 显著增强了大语言模型 (LLM) 的推理能力,但其对昂贵的人工标注数据或复杂奖励模型的依赖严重限制了可扩展性。虽然现有的自我反馈方法旨在解决此问题,但它们受限于单一模型的能力,可能导致对错误答案的过度自信、奖励黑客行为甚至训练崩溃。为此,我们提出了基于协同进化集体反馈的强化学习 (RLCCF),这是一个无需外部监督即可实现多模型协同进化的新型 RL 框架。具体而言,RLCCF 通过最大化模型集体的集体一致性 (CC) 来优化其能力,该机制联合训练一个多样化的 LLM 集成,并通过投票集体输出来提供奖励信号。此外,每个模型的投票由其自我一致性 (SC) 分数加权,确保更自信的模型对集体决策贡献更大。受益于多个 LLM 的多样化输出分布和能力互补,RLCCF 使模型集体能够通过协同进化持续增强其推理能力。在四个数学推理基准上对四个主流开源 LLM 的实验表明,我们的框架带来了显著的性能提升,准确率平均相对提升 16.72%。值得注意的是,RLCCF 不仅提升了个体模型的性能,还将群体的多数投票准确率提高了 4.51%,展示了其扩展模型集体能力边界的能力。

关键词

引用

@article{arxiv.2508.12338,
  title  = {Wisdom of the Crowd: Reinforcement Learning from Coevolutionary Collective Feedback},
  author = {Wenzhen Yuan and Shengji Tang and Weihao Lin and Jiacheng Ruan and Ganqu Cui and Bo Zhang and Tao Chen and Ting Liu and Yuzhuo Fu and Peng Ye and Lei Bai},
  journal= {arXiv preprint arXiv:2508.12338},
  year   = {2025}
}