Fusion Steering:特定提示的激活控制
计算与语言
2025-05-29 v1 人工智能
摘要
我们提出了 Fusion Steering,一种提高大语言模型 (LLM) 在问答 (QA) 任务中事实准确性的激活引导方法。该方法引入了灵活的引导配置,包括全层引导和分段引导。与受限于单层或固定层操作的传统方法不同,Fusion Steering 在所有 transformer 层中动态注入特定提示的激活增量。这些激活增量源自参考补全,该参考补全结合了真实答案与模型生成的解释,以促进语义丰富且特定于示例的引导。使用 Optuna 针对每个提示优化注入权重,其目标函数旨在平衡词元重叠(事实对齐)和困惑度(流畅度代理)。评估采用综合词元重叠和 LLM 评分质量的复合分数,涵盖事实准确性、连贯性和相关性。在 260 个 SimpleQA 提示(从基线失败的 500 个提示中选出)上的实证结果展示了分段引导的有效性。使用 8 位量化的 Gemma-2-2B-IT 时,分段引导实现了 25.4% 的准确率(得分 的输出),优于 3.5% 的基线和 16.2% 的全层引导。在更严格的 SimpleQA 评分标准下,分段引导将完全正确的响应从 0.0% 提升至 13.1%。这些发现突出了分段、动态干预策略的优势以及基于每个提示的全网络激活控制的前景。Fusion Steering 也适用于稀疏表示,例如 Neuronpedia 或稀疏交叉编码器,这为 LLM 中可解释且可扩展的激活级控制指明了有前景的方向。
关键词
引用
@article{arxiv.2505.22572,
title = {Fusion Steering: Prompt-Specific Activation Control},
author = {Waldemar Chang and Alhassan Yasin},
journal= {arXiv preprint arXiv:2505.22572},
year = {2025}
}
备注
14 pages, 4 figures, 2 tables