主观深度与时间尺度 Transformer:学习在何处以及何时计算
机器学习
2025-11-27 v1 人工智能
计算与语言
信息论
math.IT
摘要
标准 Transformer (TF) 架构中计算资源的刚性、统一分配会限制其效率和可扩展性,尤其是在大规模模型和长序列场景下。为此,本文引入了主观深度 Transformer (Subjective Depth Transformers, SDT) 和主观时间尺度 Transformer (Subjective Timescale Transformers, STT) 两种新型架构,利用贝叶斯惊讶信号动态路由计算,学习在解码器-only Transformer 中的计算位置与时机。SDT 通过交替插入决策层 (Decision layer) 与动态层 (Dynamic layer) 来增强解码器堆栈:决策层计算完整的块后验分布与轻量级先验分布,而动态层基于贝叶斯惊讶(预期变化与意外变化)采用固定容量的 Top-K 路由机制,维持静态计算图。STT 将这种条件计算扩展至时间维度:一个转换网络预测残差更新,形成时间上的“变化假设”,以此指示路由器为每个 token 动态执行或跳过 Transformer 块,管理 KV-cache 的贡献。两种架构都表现出随着训练进行从新奇到预测驱动的门控转变,表明其与惊讶原则保持一致。虽然以降低的计算容量运行,但它们为条件计算的计算-精度权衡提供了初步见解。该提出的架构为提高效率提供了灵活框架,每个计算跳过层中自注意力计算减少 75%,KV-cache 需求降低 50%,为更高效的模型铺平了道路。
引用
@article{arxiv.2511.21408,
title = {Subjective Depth and Timescale Transformers: Learning Where and When to Compute},
author = {Frederico Wieser and Martin Benfeghoul and Haitham Bou Ammar and Jun Wang and Zafeirios Fountas},
journal= {arXiv preprint arXiv:2511.21408},
year = {2025}
}