通过压缩后缀梯度来实现大语言模型行为的自我控制
计算与语言
2024-10-15 v3 人工智能
摘要
我们提出了SelfControl,这是一种利用梯度控制大型语言模型(LLM)行为的推理时控制方法,无需显式的人类标注。给定以自然语言后缀字符串拼接到输入提示后所表达的 desired behavior,SelfControl 计算 LLM 对该后缀自评估相对于其潜在表示的梯度。这些梯度用于直接控制自回归生成过程以实现 desired 行为,从而消除人工监督,实现精确且透明的控制,并提供即时适应性。为进一步提高效率,我们引入SelfControl_{Prefix},一个紧凑模块,将梯度中学习到的表示封装到SelfControl_{Prefix}中,从而实现无延迟的推理时控制,并且允许同时控制多个行为。我们的实验表明,SelfControl 在多个领域都有效,其中在去暴力化方面优于SOTA提升8.3%,在真实性提升方面提升3.1%,在情感语调控制方面提升4%~10%,在隐私保护方面提升48.2%,即完全消除隐私泄露问题。此外,我们还展示了SelfControl可用于数据合成以及提高推理能力。
引用
@article{arxiv.2406.02721,
title = {Self-Control of LLM Behaviors by Compressing Suffix Gradient into Prefix Controller},
author = {Min Cai and Yuchen Zhang and Shichang Zhang and Fan Yin and Dan Zhang and Difan Zou and Yisong Yue and Ziniu Hu},
journal= {arXiv preprint arXiv:2406.02721},
year = {2024}
}
备注
Website: https://llm-self-control.github.io/