中文

共同学习以表现更佳:通过偏好推理论证微调教导小规模 LLM 协作

计算与语言 2025-06-04 v1

摘要

诸如 GPT-4 等 LLM 已展现出通过生成逐步推理论证来解决复杂问题的卓越能力。先前的工作利用这一能力来改进较小且更廉价的 LMs(例如具有 7B 参数的模型)。然而,由于大型(通常是闭源的)模型预训练数据缺乏透明度,版权与法律问题等各种实际限制阻碍了其在商业环境中的应用。很少有研究关注在不从更大 LLM 蒸馏信息的情况下提升较小模型的内在推理能力。为解决这一问题,我们提出 COLLATE,一个可训练框架,它微调(小型)LLM,使其从一组多样化论证中生成能够选择性提升下游任务的输出。COLLATE 强制同一 LLM 的多个实例表现出不同行为,并利用它们生成论证以获得多样化输出。随后通过偏好优化微调 LLM,使其选择能最大化真实答案似然的候选论证。COLLATE 在跨 3 个领域(数学问题求解、自然语言推理和常识推理)的 5 个数据集上优于多个可训练与提示基线。我们在不同模型家族、不同参数规模(1B 至 8B)的 LLM 上展示了 COLLATE 的有效性,并通过消融实验证明了由端任务引导的多个论证提供者的益处。代码发布于 https://github.com/Sohanpatnaik106/collate。

关键词

引用

@article{arxiv.2506.02519,
  title  = {Learning Together to Perform Better: Teaching Small-Scale LLMs to Collaborate via Preferential Rationale Tuning},
  author = {Sohan Patnaik and Milan Aggarwal and Sumit Bhatia and Balaji Krishnamurthy},
  journal= {arXiv preprint arXiv:2506.02519},
  year   = {2025}
}

备注

Accepted at ACL Main 2025