重新审视现代LLM架构中的沟道变换器:在训练和推理配置中的全面消检
计算与语言
2025-04-07 v1
摘要
基于变换器的大型语言模型因高计算成本而快速发展,以至于旨在简化早期迭代的技术措施不一定能惠及更现代的模型。建立在Dai和Le(2020)提出的沟道变换器(Funnel Transformer)基础上,该模型逐级压缩中间表示,我们调查沟道在当代Gemma2变换器架构中的影响。我们系统评估各种沟道配置和恢复方法,比较:(1)标准预训练与沟道感知预训练策略,(2)沟道感知微调的影响,(3)各种序列恢复操作的类型。我们的结果表明,沟道在较大模型(例如Gemma 7B)中创建信息瓶颈,导致性能损失有时难以控制。然而,通过仔细选择沟道层并采用有效的恢复策略,可以显著减轻性能损失,实现最高可达44%的延迟降低。我们的发现凸显了计算效率与模型准确性之间的关键权衡,为在大规模自然语言应用中部署基于沟道的方法提供了实用指导。
引用
@article{arxiv.2504.02877,
title = {Revisiting Funnel Transformers for Modern LLM Architectures with Comprehensive Ablations in Training and Inference Configurations},
author = {DongHyun Choi and Lucas Spangher and Chris Hidey and Peter Grabowski and Ramy Eskander},
journal= {arXiv preprint arXiv:2504.02877},
year = {2025}
}