$n$-Musketeers:强化学习塑造语言模型间的协作
机器学习
2026-02-11 v1 人工智能
摘要
近期在可验证奖励的强化学习(RLVR)方面的进展表明,小型专门语言模型(SLM)能够在不依赖大型单一LLM的情况下展现出结构化推理能力。我们引入软隐藏状态协作机制,通过可训练的注意力界面将多个异构冻结SLM专家集成到其内部表示中。针对Reasoning Gym和GSM8K上的实验表明,这种潜在集成与强大的单模型RLVR基线相当。进一步的消融实验揭示了专家利用的双重机制:对于较简单的算术领域,性能提升主要可由静态专家偏好所解释;而在更具挑战性的环境下,训练过程中专家注意力的集中程度和结构化程度日益增加,表明存在专家如何连接到相关专家方面的新兴专化。总体而言,隐藏状态协作提供了一种紧凑的机制,用以利用冻结专家,同时为观察专家利用模式及其在RLVR下的演化提供了窗口。
引用
@article{arxiv.2602.09173,
title = {$n$-Musketeers: Reinforcement Learning Shapes Collaboration Among Language Models},
author = {Ryozo Masukawa and Sanggeon Yun and Hyunwoo Oh and SuhgHeon Jeong and Raheeb Hassa and Hanning Chen and Wenjun Huang and Mahdi Imani and Pietro Mercati and Nathaniel D. Bastian and Mohsen Imani},
journal= {arXiv preprint arXiv:2602.09173},
year = {2026}
}