通过影响函数纠正大语言模型行为
机器学习
2024-12-24 v1 人工智能
计算与语言
摘要
近期 AI 对齐技术的进展显著提升了大语言模型 (LLM) 与静态人类偏好之间的对齐。然而,人类偏好的动态性质会使一些先前训练数据过时甚至出错,最终导致 LLM 偏离当代人类偏好和社会规范。现有方法无论是通过收集新数据进行持续对齐,还是通过人工纠正过时数据进行重新对齐,都需要高昂的人力成本。为此,我们提出一种新方法:Large Language Model Behavior Correction with Influence Function Recall and Post-Training (LANCET),无需人工参与。LANCET 包含两个阶段:(1) 使用影响函数识别显著影响不当模型输出的训练数据,(2) 应用基于影响函数的 Bregman 优化 (IBO) 技术根据这些影响分布调整模型行为。我们的实验表明,LANCET 能有效且高效地纠正 LLM 的不当行为。此外,LANCET 可超越依赖收集人类偏好的方法,并增强了在 LLM 中学习人类偏好的可解释性。
引用
@article{arxiv.2412.16451,
title = {Correcting Large Language Model Behavior via Influence Function},
author = {Han Zhang and Zhuo Zhang and Yi Zhang and Yuanzhao Zhai and Hanyang Peng and Yu Lei and Yue Yu and Hui Wang and Bin Liang and Lin Gui and Ruifeng Xu},
journal= {arXiv preprint arXiv:2412.16451},
year = {2024}
}