无探针的低秩激活干预
机器学习
2025-02-07 v1 人工智能
摘要
语言模型(LMs)可能生成看似准确连贯但包含不真实或有毒内容的文本。编辑隐藏激活的推理时干预在引导语言模型生成理想内容方面显示出有希望的结果。现有的激活干预方法通常包含一个激活探针来检测不良生成,从而触发激活修改以引导后续生成。本文提出了一种无探针的干预方法FLORAIN,用于特定激活层中的所有注意力头。它消除了为探测目的训练分类器的需要。干预函数由一个样本级非线性低秩映射参数化,该映射通过最小化修改后的激活与其在理想内容流形上的投影之间的距离来训练。在流形和投影距离的特定构造下,我们表明可以通过求解一个平滑优化问题来高效计算干预策略。在多个基础模型上基准测试的实证结果表明,FLORAIN在生成任务和多项选择任务中,在增强模型真实性和质量方面,始终优于几种基线方法。
引用
@article{arxiv.2502.04043,
title = {Probe-Free Low-Rank Activation Intervention},
author = {Chonghe Jiang and Bao Nguyen and Anthony Man-Cho So and Viet Anh Nguyen},
journal= {arXiv preprint arXiv:2502.04043},
year = {2025}
}
备注
Accepted by NAACL 2025