SpeLLM:字符级多头解码
计算与语言
2025-07-23 v1
摘要
扩大 LLM 词表常用于减少输入序列长度并缓解注意力机制二次计算开销。然而,当前 LLM 架构对此过程施加了关键瓶颈:输出投影层随词表大小线性缩放,使得大幅扩展不切实际。我们提出 SpeLLM,一种通过多个输出头预测字符级字符串来解耦输入和输出词表的方法。在 SpeLLM 中, 个线性头中的每一个同时预测单个字符,使模型能够使用更小、独立的线性头表示更大的输出空间。我们提出一种自蒸馏方法,将标准 LLM 转换为 SpeLLM。我们在四个预训练 LLM 上的实验表明,其 SpeLLM 变体在下游任务上取得了有竞争力的性能,同时跨模型平均减少了 5.1% 的运行时间。我们的方法为降低 LLM 成本提供了一条潜在途径,同时增加了对代表性不足的语言和领域的支持。
引用
@article{arxiv.2507.16323,
title = {SpeLLM: Character-Level Multi-Head Decoding},
author = {Amit Ben-Artzy and Roy Schwartz},
journal= {arXiv preprint arXiv:2507.16323},
year = {2025}
}