中文

死权活信号:冻结大语言模型的前馈图

机器学习 2026-04-10 v1 人工智能

摘要

我们提出了一种前馈图架构,其中异构冻结大语言模型作为计算节点,通过通过学习的线性投影在共享的连续潜在空间中进行通信。建立在最近表明独立训练的 LLM 潜在空间之间存在几何兼容性基础上,我们将这一发现从静态双模型驾驭扩展到端到端可训练的多节点图,其中投影矩阵通过反向传播通过残差流注入钩子进行联合优化。我们使用三个小型冻结模型(Llama-3.2-1B、Qwen2.5-1.5B、Gemma-2-2B)将输入编码为共享潜在空间,其聚合信号被注入两个更大的冻结模型(Phi-3-mini、Mistral-7B),其表示反馈给轻量级的跨注意力输出节点。该架构仅使用约 1.76 亿可训练参数(相对于约 120 亿冻结参数),便实现了在 ARC-Challenge 上达到 87.3%,在 OpenBookQA 上达到 82.8%,在 MMLU 上达到 67.2%,分别比其最佳单一组成部分模型高出 11.4、6.2 和 1.2 个百分点,也比参数匹配的学习型分类器在冻结单一模型上高出 9.1、5.2 和 6.7 个百分点。我们经验性地验证了通过多个冻结模型边界的梯度流是可行的,输出节点在没有显式监督的情况下发展出对第 2 层节点的选择性路由行为。

关键词

引用

@article{arxiv.2604.08335,
  title  = {Dead Weights, Live Signals: Feedforward Graphs of Frozen Language Models},
  author = {Marcus Armstrong and Navid Ayoobi and Arjun Mukherjee},
  journal= {arXiv preprint arXiv:2604.08335},
  year   = {2026}
}