高效地使用在线自然语言反馈对齐语言模型
机器学习
2026-05-07 v1 人工智能
摘要
强化学习结合可验证奖励已被广泛用于从语言模型中引导出惊人性能,但在需要训练具有“模糊”难以监督领域能力的广泛实际部署场景中,可能需要我们使用来自人类专家的高质量监督信号。本文发展了在模糊领域中对语言模型进行对齐的方法,人类专家仍能提供高质�的监督信号,但仅针对少量模型输出。具体而言,我们通过迭代优化代理奖励信号、在过度优化点处收集新鲜的专家监督并更新代理奖励来训练模型。我们采用基于原语学习(ICL)和微调的方法构建代理奖励模型。我们通过引导 Qwen3-8B 和 Haiku 4.5 的创意写作和对齐研究能力来测试我们的方法。对于 Qwen3-8B,ICL 方法在 50 倍更少的专家样本下恢复最高可达 35% 的性能,而微调方法在最高可少 20 倍样本下恢复 80% 的性能,或在 3 倍样本下恢复 100% 的性能。对于 Haiku 4.5,ICL 方法在 30 倍更少的样本下恢复最高可达 35% 的性能,微调方法在 10 倍更少的样本下恢复 100% 的性能。我们的结果表明,在线自然语言反馈可以显著提高专家监督的数据效率。
引用
@article{arxiv.2605.04356,
title = {Efficiently Aligning Language Models with Online Natural Language Feedback},
author = {Christine Ye and Joe Benton},
journal= {arXiv preprint arXiv:2605.04356},
year = {2026}
}