中文

面向概念异构性的表示引导

机器学习 2026-03-04 v1 人工智能

摘要

表示引导提供了一种通过在推理时干扰内部激活来控制大型语言模型(LLM)行为的轻量级机制。大多数现有方法依赖单一的全局引导方向,通常通过对比数据集的均值差异获取。这一方法隐含地假设目标概念在嵌入空间中均匀表示。实际上, however,LLM 表示可能高度非均匀,表现出聚类、上下文依赖的结构,这使得全局引导方向脆弱。本文通过最优传输(OT)的视角来观察表示引导,指出标准的均值差异引导隐式对应于两个具有相同协方差的单模态高斯分布之间的 OT 映射,产生全局平移。为松弃这一限制性假设,我们理论上将源和目标表示建模为高斯混合模型,并将引导建模为语义潜在聚类之间的离散 OT 问题。从所得传输方案中,我们通过 barycentric 投影推导出显式的、输入依赖的引导映射,产生由聚类级别位移的平滑、核加权组合。我们称该方法为概念异构性感知表示引导(Concept Heterogeneity-aware Representation Steering, CHaRS)。通过大量实验设置,我们展示 CHaRS 在全局引导之上更有效的行为控制。

关键词

引用

@article{arxiv.2603.02237,
  title  = {Concept Heterogeneity-aware Representation Steering},
  author = {Laziz U. Abdullaev and Noelle Y. L. Wong and Ryan T. Z. Lee and Shiqi Jiang and Khoi N. M. Nguyen and Tan M. Nguyen},
  journal= {arXiv preprint arXiv:2603.02237},
  year   = {2026}
}