PHOTON:用于光速和内存高效语言生成的层次自回归模型
机器学习
2026-01-09 v2 人工智能
计算与语言
分布式、并行与集群计算
摘要
Transformer 以水平 token-by-token 的方式运行;在每个生成步骤中,都要访问不断增长的 token 级别状态序列。这种访问模式增加了预填充延迟,使长上下文解码更加内存受限,因为 KV 缓存的读取和写入在算术运算之上占据主导时间。我们提出了面向 Top-down Networks 的 Parallel Hierarchical Operation(PHOTON),一种层次自回归模型,用垂直、多分辨率上下文扫描取代水平扫描。PHOTON 维护一层次的潜在流:底层编码器将 token 压缩为低比特的上下文状态,而轻量级顶层解码器则并行重建细粒度的 token 表示。我们进一步引入了递归生成,这仅更新最粗糙的潜在流并消除底层重新编码。实验结果表明,PHOTON 在吞吐量-质量权衡方面优于竞争性的基于 Transformer 的语言模型,特别是在长上下文和多查询任务中具有优势。特别是,这减少了解码时 KV 缓存流量,实现了每单位内存的吞吐量提高最高可达 。
引用
@article{arxiv.2512.20687,
title = {PHOTON: Hierarchical Autoregressive Modeling for Lightspeed and Memory-Efficient Language Generation},
author = {Yuma Ichikawa and Naoya Takagi and Takumi Nakagawa and Yuzi Kanazawa and Akira Sakai},
journal= {arXiv preprint arXiv:2512.20687},
year = {2026}
}
备注
17 pages, 10 figures