自适应激活引导:一种面向多种幻觉类别的免调优大语言模型真实性提升方法
计算与语言
2025-02-27 v2 人工智能
摘要
近期研究表明,大型语言模型内在地具备对真实性的理解,但往往无法一致地表达这种理解并生成虚假陈述。这种“知晓”与“表述”之间的差距对确保生成内容的真实性构成了挑战。受近期关于在大型语言模型内以线性方式编码人类可解释概念的研究启发,我们将真实性视为大型语言模型中一种特殊线性编码的概念,并引入自适应激活引导(ACT),这是一种免调优方法,在推理过程中自适应地将大型语言模型的激活向“真实”方向偏移。ACT通过利用多样化的真实性相关引导向量并自适应调整引导强度,来应对多种类别的幻觉。作为附加组件应用于各种模型,ACT显著提升了LLaMA(提升142%)、LLaMA2(提升24%)、Alpaca(提升36%)、Vicuna(提升28%)、LLaMA2-Chat(提升19%)和LLaMA3(提升34%)的真实性。此外,我们验证了ACT在更大规模模型(13B、33B、65B)上的可扩展性,突显了ACT对大规模语言模型的适应性。我们的代码可在https://github.com/tianlwang/ACT获取。
引用
@article{arxiv.2406.00034,
title = {Adaptive Activation Steering: A Tuning-Free LLM Truthfulness Improvement Method for Diverse Hallucinations Categories},
author = {Tianlong Wang and Xianfeng Jiao and Yinghao Zhu and Zhongzhi Chen and Yifan He and Xu Chu and Junyi Gao and Yasha Wang and Liantao Ma},
journal= {arXiv preprint arXiv:2406.00034},
year = {2025}
}
备注
ACM TheWebConf 2025 Conference (WWW 2025) Research Track