通过构建置信方向有效引导 LLM 遵循偏好
计算与语言
2025-03-06 v1 人工智能
摘要
拥有与人类偏好对齐的大语言模型(LLM)对于满足个体需求(如保持写作风格或生成特定感兴趣的主题)至关重要。当前大多数对齐方法依赖于微调或提示,这要么成本高昂,要么难以控制。模型引导算法通过构建特定的引导方向来修改模型输出,通常易于实现且无需优化。然而,其能力通常仅限于将模型引导到两个方向之一(即双向引导),且尚无理论理解来保证其性能。在本工作中,我们提出了一个理解和量化模型引导方法的理论框架。受该框架启发,我们提出了一种置信方向引导方法(CONFST),通过修改 LLM 在推理时的激活来引导模型。具体而言,CONFST 构建了一个与用户偏好紧密对齐的置信方向,然后将该方向添加到 LLM 的激活中以有效引导模型输出。与流行的双向模型引导方法相比,我们的方法具有三个关键优势:1)更强大,因为可以同时对齐多个(不止两个)用户偏好;2)实现简单,因为无需确定添加引导向量所在的层;3)不需要显式的用户指令。我们在 GPT-2 XL(1.5B)、Mistral(7B)和 Gemma-it(9B)模型上验证了本方法,在需要在各种主题和风格之间切换 LLM 输出的任务上取得了优于竞争方法的性能。
引用
@article{arxiv.2503.02989,
title = {Effectively Steer LLM To Follow Preference via Building Confident Directions},
author = {Bingqing Song and Boran Han and Shuai Zhang and Hao Wang and Haoyang Fang and Bonan Min and Yuyang Wang and Mingyi Hong},
journal= {arXiv preprint arXiv:2503.02989},
year = {2025}
}