中文

基于锚点投影表示的行为轴跨家族普适性

人工智能 2026-05-12 v1

摘要

来自不同家族的大语言模型使用不同的隐藏维度、分词器和训练流程,使得行为方向难以跨模型进行比较或迁移。我们引入了一个锚点投影框架,将每个模型的隐藏表示映射到一个共享的锚点坐标空间(ACS)。从源模型中提取的行为方向被投影到 ACS 中并平均为一个规范方向。对于新模型,仅使用锚点激活即可将该规范方向重构至其原生隐藏空间,无需微调或针对特定目标提取方向。我们评估了五个经过指令微调的模型家族和十个行为轴。我们发现,在 ACS 中的 Llama-Qwen-Mistral-Phi (LQMP) 簇内,同轴方向紧密对齐。这种共享结构可迁移至下游任务。对于对齐的 LQMP 簇,留出目标实现了 0.83 的十类检测准确率和 0.95 的平均二分类 AUROC,而规范引导在分布偏移下引发了高达 +0.46% 的拒绝率偏移。敏感性分析表明,仅用两个源模型和少量锚点池便足以近似可迁移方向。总体而言,ACS 为跨家族可解释性提供了新视角,揭示了表示级别的迁移在不同模型家族间保持鲁棒。

关键词

引用

@article{arxiv.2605.09875,
  title  = {Cross-Family Universality of Behavioral Axes via Anchor-Projected Representations},
  author = {Su-Hyeon Kim and Yo-Sub Han},
  journal= {arXiv preprint arXiv:2605.09875},
  year   = {2026}
}