中文

通过跨层几何改进 LLM 最终表示

计算与语言 2026-05-14 v3 机器学习

摘要

LLM 基于预测的标准做法是使用最终层的表示作为下游预测器的输入。然而,中间层可能编码了互补的任务相关信号。现有方法因此要么搜索每个任务的最佳层,要么应用高昂的注意力机制来学习跨层聚合。在本工作中,我们首先表明,这种复杂性是不必要的:针对 LLM 层的完全连接图的轻量级图神经网络更高效,且在预测性能上显著优于现有方法。随后,我们引入 Cayley-Encoder,通过将完全连接图替换为 SL(2, Zn) 上的 Cayley 图,进一步提高了效率和预测性能。Cayley 图提供了一种稀疏、构造上规则且直径较小的数学依据拓扑,有效地实现跨层的通信,同时约束聚合结构,降低 GNN 过拟合的风险。在针对 13 个任务和 9 个 LLM 进行 Cayley-Encoder 评估时,该方法一致优于基线,准确率提升最高可达 40 个百分点,而引入的参数仅为 LLM 规模的 0.1%。我们进一步表明 Cayley-Encoder 在 few-shot 场景中同样有效。最后,我们表明 Cayley-Encoder 在冻结 LLM 的情况下优于 LoRA 微调。我们总结性地通过可解释性分析表明,多个层对最终预测具有实质性贡献,支持我们的假设。

关键词

引用

@article{arxiv.2603.22665,
  title  = {Improving LLM Final Representations with Inter-Layer Geometry},
  author = {Tom Ulanovski and Eyal Blyachman and Maya Bechler-Speicher},
  journal= {arXiv preprint arXiv:2603.22665},
  year   = {2026}
}

备注

17 pages, 4 figures. Equal contribution by first two authors