Nudging:通过引导解码实现 LLM 推理时对齐
计算与语言
2025-06-05 v4 人工智能
机器学习
摘要
大型语言模型(LLM)需要对齐才能有效且安全地遵循用户指令。该过程需要为每个基础模型训练一个对齐版本,导致计算开销巨大。本文提出 NUDGING,一种简单且无需训练的算法,通过小型对齐模型在推理时对任意基础模型进行对齐。我们发现,对齐主要会改变模型在少数风格标记(如语篇标记)上的行为。我们发现,当生成这些标记时,基础模型不确定性显著更高。基于这一洞察,NUDGING 采用小型对齐模型生成引导性标记,以在基础模型不确定性较高时引导其输出,在解码时仅增加轻微的额外推理开销。我们在三个模型家族中,对 NUDGING 进行了评估,涵盖多样化的开放指令任务。无需任何训练,利用 7 倍至 14 倍更小的对齐模型对大型基础模型进行引导,可实现零样本性能,与大型对齐模型相当,甚至时更好。通过在标记级别工作,NUDGING 实现了即插即用型的模型家族间协作。例如,用 Llama-27b-chat 对 Gemma-2-27b 进行引导,在各种任务上均优于 Llama-2-70b-chat。总体而言,本工作提供了一种模块化且高性价比的 LLM 对齐解决方案。我们的代码和演示可在 https://fywalter.github.io/nudging/ 查看。
引用
@article{arxiv.2410.09300,
title = {Nudging: Inference-time Alignment of LLMs via Guided Decoding},
author = {Yu Fei and Yasaman Razeghi and Sameer Singh},
journal= {arXiv preprint arXiv:2410.09300},
year = {2025}
}
备注
Accepted to ACL 2025 (main)