通过基于稀疃自编码器的表示工程引导 LLM 中的知识选择行为
计算与语言
2025-02-11 v3
摘要
大型语言模型(LLM)能够在其参数中存储大量事实知识。然而,其参数化知识可能与上下文提供的信息冲突——这种现象称为“上下文-记忆知识冲突”,可能导致模型出现不可取的行为,如依赖过时或不正确的信息。分析 LLM 的内部激活,我们发现它们能够在中层内部注册知识冲突信号。这种信号允许我们检测是否发生知识冲突,并使用“推理时”干预策略来解决它。在本工作中,我们提出了一种名为 \textsc{SpARE} 的方法,这是一种无训练的表示工程方法,利用预训练的稀疃自编码器(SAE)来控制 LLM 的知识选择行为。\textsc{SpARE} 识别控制知识选择行为的功能特征,并将其应用于在推理时编辑 LLM 的内部激活。我们的实验结果表明,\textsc{SpARE} 能够有效控制在开放域问答任务中知识来源的使用,显著优于现有的表示工程方法(提升约 10%)以及对比解码方法(提升约 15%)。
引用
@article{arxiv.2410.15999,
title = {Steering Knowledge Selection Behaviours in LLMs via SAE-Based Representation Engineering},
author = {Yu Zhao and Alessio Devoto and Giwon Hong and Xiaotang Du and Aryo Pradipta Gema and Hongru Wang and Xuanli He and Kam-Fai Wong and Pasquale Minervini},
journal= {arXiv preprint arXiv:2410.15999},
year = {2025}
}
备注
Accepted at NAACL 2025