中文

半场已成:基于弱到强解码的数据稀缺偏好对齐方法

计算与语言 2025-06-10 v1 人工智能

摘要

大型语言模型(LLM)需要与人类偏好进行对齐,以避免生成冒犯、虚假或无意义的内容。近期,针对数据稀缺场景的语言模型对齐方法备受关注,但仍面临在获取高质量且对齐内容方面的挑战。基于观察到生成对齐响应的难度集中于解码初期这一现象,我们提出了一种新型框架——弱到强解码(Weak-to-Strong Decoding, WSD),通过引导小型对齐模型来增强底层模型的对齐能力。该框架中,小模型首先生成高度对齐的开头内容,随后由大型底模型继续生成剩余部分,同时通过精心设计的自动切换机制进行控制。我们还收集了一个新数据集GenerAlign,用于微调一个小型的Pilot-3B作为草稿模型。实验表明,在WSD框架下,该方法能有效提升各种底层模型的性能,超越所有基线方法,同时避免因对下游任务产生负面影响而导致的对齐税(alignment tax)。我们进一步开展了大量实验,考察了不同设置的影响、时间效率,以及对WSD内在机制的深入分析。

关键词

引用

@article{arxiv.2506.07434,
  title  = {Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding},
  author = {Feifan Song and Shaohang Wei and Wen Luo and Yuxuan Fan and Tianyu Liu and Guoyin Wang and Houfeng Wang},
  journal= {arXiv preprint arXiv:2506.07434},
  year   = {2025}
}

备注

Accepted by ACL 2025 Findings