GrAInS:基于梯度的归因用于推理时控制大语言模型和视觉语言模型
计算与语言
2025-07-25 v1 人工智能
计算机视觉与模式识别
摘要
推理时控制方法提供了一种无需更新模型权重即可通过修改测试时内部激活来实现的轻量级替代方案,这对于大语言模型(LLM)和视觉语言模型(VLM)而言尤为重要。然而,大多数现有方法依赖固定的全局干预向量,忽视了单个输入标记的因果影响,更未能充分利用来自模型logit的信息,尤其是在视觉和文本输入贡献不均的多模态环境中。为克服这些限制,我们引入GrAInS,一种可跨语言模型和视觉语言模型以及相关任务工作的方法。GrAInS通过集成梯度归因(Integrated Gradients)实现对比性梯度归因,以识别最具影响力的前k个标记,这些标记在正向和负向归因方面都具有显著贡献——即它们对优先于次选输出的贡献。然后,这些标记用于构建导向性干预向量,以捕捉从不可取行为向理想行为的语义偏移。在推理过程中,GrAInS根据标记级别的归因信号调整Transformer各层的隐藏激活,并对激活进行归一化处理以保持表示规模。这使得可以在不重新训练或使用辅助监督的情况下,对模型行为实现细粒度、可解释且模块化的控制。经实验证明,GrAInS在各类基准测试中均显著优于微调和现有控制方法:在Llama-3.1-8B上实现TruthfulQA准确率提升13.22%,在MMHal-Bench上将LLaVA-1.6-7B的幻觉率从0.624降至0.514,在SPA-VL上实现对齐获胜率提升8.11%,同时保持了模型的流畅性和通用能力。
引用
@article{arxiv.2507.18043,
title = {GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs},
author = {Duy Nguyen and Archiki Prasad and Elias Stengel-Eskin and Mohit Bansal},
journal= {arXiv preprint arXiv:2507.18043},
year = {2025}
}
备注
21 pages. Code: https://github.com/duykhuongnguyen/GrAInS