中文

通过定向干预实现大语言模型的多属性驾驶

计算与语言 2025-07-10 v2 人工智能 机器学习

摘要

推理时干预(ITI)已成为通过在 token 表示上进行干预而不进行高昂参数更新来引导大型语言模型(LLM)行为的有前景方法。然而,现有 ITI 方法难以扩展到具有冲突的多属性设置,例如在提高有用性的同时也降低有害性。为此,我们引入了多属性定向驾驶(MAT-Steer),这是一种为在多个属性上进行选择性 token 级干预而设计的新型驾驶框架。MAT-Steer 通过对齐目标函数学习驾驶向量,将模型对不良输出的内部表示移动到优良输出的表示之间,同时通过稀疏化和正交化来减少不同属性向量之间的相互冲突。在两个不同设置中评估 MAT-Steer:(i)在问答(QA)任务上平衡真实性、偏见和有害性等属性;(ii)在生成任务中同时提高有用性、正确性和连贯性。MAT-Steer 在两种任务类型中均优于现有 ITI 和参数高效微调方法(例如,在 QA 任务中实现 3% 的平均准确率提升,并以 55.82% 的获胜率击败最佳 ITI 基线)。

关键词

引用

@article{arxiv.2502.12446,
  title  = {Multi-Attribute Steering of Language Models via Targeted Intervention},
  author = {Duy Nguyen and Archiki Prasad and Elias Stengel-Eskin and Mohit Bansal},
  journal= {arXiv preprint arXiv:2502.12446},
  year   = {2025}
}

备注

ACL 2025 camera-ready, code link: https://github.com/duykhuongnguyen/MAT-Steer