ODESteer:面向 LLM 对齐的统一 ODE 基于驾向框架
人工智能
2026-02-24 v2
摘要
激活驾向或表征工程提供了一种轻量级方法,通过在推理时操控 LLM 的内部激活来实现对齐。然而,当前方法存在两个关键局限:(i) 缺乏统一的理论框架来指导驾向方向的设计,以及 (ii) 过度依赖单步驾向,无法捕捉激活分布的复杂模式。本文提出了基于普通微分方程 (ODE) 的统一理论框架,用于 LLM 对齐中的激活驾向。我们展示,常规激活添加可被解释为求解 ODE 的一阶近似。基于此 ODE 视角,识别驾向方向等价于来自控制论中的障碍函数设计。derived from this framework,我们引入 ODESteer,这是一种由障碍函数引导的 ODE 基于驾向方法,在 LLM 对齐方面实现了实证性进步。ODESteer 通过将障碍函数定义为正负激活对数密度比来识别驾向方向,并利用它构建多步自适应驾向的 ODE。与最先进的激活驾向方法相比,ODESteer 在多样化的 LLM 对齐基准测试上实现了持续的实证性改进,TruthfulQA 上提升约 5.7%,UltraFeedback 上提升 2.5%,RealToxicityPrompts 上提升 2.4%。本工作通过将激活驾向的理论基础统一至 ODEs 中,建立了 LLM 对齐中激活驾向的原则性新视角,并通过所提出的 ODESteer 方法进行实证验证。
引用
@article{arxiv.2602.17560,
title = {ODESteer: A Unified ODE-Based Steering Framework for LLM Alignment},
author = {Hongjue Zhao and Haosen Sun and Jiangtao Kong and Xiaochang Li and Qineng Wang and Liwei Jiang and Qi Zhu and Tarek Abdelzaher and Yejin Choi and Manling Li and Huajie Shao},
journal= {arXiv preprint arXiv:2602.17560},
year = {2026}
}
备注
Accepted by ICLR 2026 (Camera Ready Version)