大语言模型对齐的渐进式标签增强
计算与语言
2024-10-10 v2 人工智能
摘要
大语言模型(LLM)对齐旨在防止模型产生与人类期望不一致的内容,从而引发伦理和法律问题。过去几年中,基于人类反馈的强化学习(RLHF)是实现对齐的最突出方法。由于 RLHF 阶段中多个模型之间的复杂交互带来的稳定性和可扩展性挑战,研究人员正在探索替代方法以实现与 RLHF 相当的效果。然而,这些方法通常依赖大规模高质量数据集。尽管一些方法考虑生成额外数据来扩展数据集,但它们往往将模型训练和数据生成视为独立且静态的过程,忽视了这些过程高度相互依赖的事实,导致生成数据的利用效率低下。为了解决这个问题,本文提出 PLE,即大语言模型对齐的渐进式标签增强(Progressively Label Enhancement for LLM Alignment),这是一个根据生成数据质量的演变动态调整模型训练过程的框架。具体而言,本文提示模型为原始查询和由一组精心设计的原则引导的查询生成响应,然后利用动态阈值根据相应的奖励分数确定两种响应的适当训练方法。实验结果证明了 PLE 相较于现有 LLM 对齐方法的有效性。
引用
@article{arxiv.2408.02599,
title = {Progressively Label Enhancement for Large Language Model Alignment},
author = {Biao Liu and Ning Xu and Xin Geng},
journal= {arXiv preprint arXiv:2408.02599},
year = {2024}
}