SPaR:基于树搜索精炼的自我对弈以改进大语言模型的指令跟随
计算与语言
2025-03-18 v2 人工智能
机器学习
摘要
指令跟随是语言模型的一项基本能力,要求模型识别指令中最细微的要求并准确反映在输出中。这种能力非常适合通过偏好学习来优化,且通常以此方式优化。然而,现有方法在创建偏好对时,通常直接从模型中采样多个独立响应。这种做法会引入与指令是否被精确遵循无关的内容变化(例如,相同语义的不同表达),干扰了教会模型识别导致改进指令跟随的关键差异的目标。鉴于此,我们引入SPaR,一个自我对弈框架,集成了树搜索自我精炼以产生有效且可比较的、无干扰的偏好对。通过与自身博弈,LLM采用树搜索策略,在最小化不必要变化的同时,根据指令精炼其先前的响应。我们的实验表明,在SPaR指导下经过三次迭代训练的LLaMA3-8B模型,在不损失通用能力的情况下,在IFEval基准上超越了GPT-4-Turbo。此外,SPaR展现出有前景的可扩展性,显著增强了GLM-4-9B和LLaMA3-70B等模型。我们还识别了树搜索中的推理缩放如何影响模型性能。我们的代码和数据公开在https://github.com/thu-coai/SPaR。
引用
@article{arxiv.2412.11605,
title = {SPaR: Self-Play with Tree-Search Refinement to Improve Instruction-Following in Large Language Models},
author = {Jiale Cheng and Xiao Liu and Cunxiang Wang and Xiaotao Gu and Yida Lu and Dan Zhang and Yuxiao Dong and Jie Tang and Hongning Wang and Minlie Huang},
journal= {arXiv preprint arXiv:2412.11605},
year = {2025}
}
备注
ICLR 2025