中文

重新审视现代LLM架构中的沟道变换器:在训练和推理配置中的全面消检

计算与语言 2025-04-07 v1

摘要

基于变换器的大型语言模型因高计算成本而快速发展,以至于旨在简化早期迭代的技术措施不一定能惠及更现代的模型。建立在Dai和Le(2020)提出的沟道变换器(Funnel Transformer)基础上,该模型逐级压缩中间表示,我们调查沟道在当代Gemma2变换器架构中的影响。我们系统评估各种沟道配置和恢复方法,比较:(1)标准预训练与沟道感知预训练策略,(2)沟道感知微调的影响,(3)各种序列恢复操作的类型。我们的结果表明,沟道在较大模型(例如Gemma 7B)中创建信息瓶颈,导致性能损失有时难以控制。然而,通过仔细选择沟道层并采用有效的恢复策略,可以显著减轻性能损失,实现最高可达44%的延迟降低。我们的发现凸显了计算效率与模型准确性之间的关键权衡,为在大规模自然语言应用中部署基于沟道的方法提供了实用指导。

关键词

引用

@article{arxiv.2504.02877,
  title  = {Revisiting Funnel Transformers for Modern LLM Architectures with Comprehensive Ablations in Training and Inference Configurations},
  author = {DongHyun Choi and Lucas Spangher and Chris Hidey and Peter Grabowski and Ramy Eskander},
  journal= {arXiv preprint arXiv:2504.02877},
  year   = {2025}
}