中文

变压器是否在深度上自适应地使用?来自关系推理任务的证据

机器学习 2026-04-15 v1 计算与语言

摘要

我们探讨了变压器在难度递增的任务中是否在深度上自适应地使用。我们基于家庭故事构建了一个受控的多跳关系推理任务,其中难度由必须组合的关系跳数决定。我们通过(i)通过早期读出(logit 镜头)监控预测在各层中的演变情况,以及(ii)通过因果补丁监控任务相关信息在标记之间的集成方式。对于预训练模型,我们发现某些较大模型在更简单的任务中需要更少的层即可到达合理答案,且模型通常在链长度增加时使用更多层来整合跨标记的信息。对于在该任务上微调的模型,我们发现更清晰且更一致的自适应深度使用证据,效果在不受约束的微调方案中更为明显,这些方案不保留通用语言建模能力。

关键词

引用

@article{arxiv.2604.12426,
  title  = {Do Transformers Use their Depth Adaptively? Evidence from a Relational Reasoning Task},
  author = {Alicia Curth and Rachel Lawrence and Sushrut Karmalkar and Niranjani Prasad},
  journal= {arXiv preprint arXiv:2604.12426},
  year   = {2026}
}

备注

Accepted at the ICLR 2026 Workshop on Logical Reasoning of Large Language Models