弱到强搜索:通过在小型语言模型上搜索来对齐大型语言模型
计算与语言
2024-11-20 v3 人工智能
机器学习
摘要
大型语言模型通常被微调以对齐人类偏好。然而,对大型语言模型进行微调可能具有挑战性。在本工作中,我们引入了“弱到强搜索”概念,将大型语言模型的对齐表述为一种在冻结的大模型上进行测试时贪心搜索,以最大化小型微调模型与未微调模型之间的对数概率差。该方法既是一种计算高效的模型扩展策略,避免直接微调大模型,也是一种弱到强泛化实例,通过弱测试时指导来增强强模型。实验表明,弱到强搜索在不同任务上具有灵活性。在受控情感生成和摘要任务中,我们使用微调和未微调的 gpt2 来改进大型模型的对齐,而无需额外训练。关键的是,在更具挑战性的指令遵循基准测试 AlpacaEval 2.0 中,我们展示了即使使用小型模型(如 zephyr-7b-beta 及其未微调版本)也能提高大型模型(包括白盒和黑盒模型)相对于 gpt-4-turbo 的长度控制获胜率(例如,Llama-3-70B-Instruct 从 34.4% 提升至 37.9%,gpt-3.5-turbo-instruct 从 16.0% 提升至 20.1%),尽管这些小型模型的获胜率约为 10.0%。
引用
@article{arxiv.2405.19262,
title = {Weak-to-Strong Search: Align Large Language Models via Searching over Small Language Models},
author = {Zhanhui Zhou and Zhixuan Liu and Jie Liu and Zhichen Dong and Chao Yang and Yu Qiao},
journal= {arXiv preprint arXiv:2405.19262},
year = {2024}
}
备注
NeurIPS 2024