中文

线性表示可迁移性假设:利用小模型引导大模型

机器学习 2025-06-06 v3 人工智能 计算与语言

摘要

已有假设提出,具有相似架构并在相似数据上训练的神经网络会学习与学习任务相关的共享表示。我们在此基础上扩展了概念框架,即在相同数据上训练的不同模型所学习到的表示可以表示为 \emph{通用} 基特征集合的线性组合。这些基特征是学习任务本身的基础,且在不同模型中保持一致,与规模无关。基于该框架,我们提出了 \textbf{Linear Representation Transferability (LRT)} 假设——即不同模型的表示空间之间存在仿射变换。为了检验这一假设,我们在不同大小模型的隐藏状态之间学习仿射映射,并评估引导向量(与特定模型行为相关的隐藏状态空间中的方向)在使用所学映射从小语言模型迁移到大语言模型时是否保留其语义效应。我们发现了强有力的经验证据表明此类仿射映射能够保留引导行为。这些发现表明,小模型学习到的表示可用于引导大模型的行为,且 LRT 假设可能是理解跨模型规模表示对齐的一个有前景的方向。

关键词

引用

@article{arxiv.2506.00653,
  title  = {Linear Representation Transferability Hypothesis: Leveraging Small Models to Steer Large Models},
  author = {Femi Bello and Anubrata Das and Fanzhi Zeng and Fangcong Yin and Liu Leqi},
  journal= {arXiv preprint arXiv:2506.00653},
  year   = {2025}
}