PRISM:突破长上下文 LLM 推理中的 O(n) 内存壁垒 via O(1) 光子块选择
光学
2026-03-26 v2 人工智能
硬件体系结构
计算与语言
机器学习
摘要
长上下文 LLM 推理的瓶颈不在于计算能力,而在于每个解码步骤都要扫描 KV 缓存的 O(n) 内存带宽成本——这种壁垒无法通过算术规模扩张来突破。最近的光子加速器已展现出处理密集注意力计算的优异吞吐量,但这些方法在应用到长上下文时仍继承电子注意力的 O(n) 内存规模。我们发现,真正的利用点在于粗粒度块选择步骤:一个内存受限的相似性搜索,用于确定要检索的 KV 块。我们首次识别到,这一任务在结构上匹配光子广播加权范式——查询信号通过被动分叉发送至所有候选者,签名是准静态的(匹配电光 MRR 编程),且仅关心排序顺序(放宽精度至 4-6 位)。关键在于,随着上下文长度增加,光子优势也随之增长:当 N 增大时,电子扫描成本呈线性上升,而光子评估保持 O(1)。我们在此基础上实现了PRISM(Photonic Ranking via Inner-product Similarity with Microring weights),即一种薄膜锂硅 (TFLN) 相似性引擎。经硬件受限的针织针头针茧评估于 Qwen2.5-7B 上,确认在 k=32 时,4K 至 64K tokens 均可实现 100% 准确率,64K 上下文下实现 16 倍流量降低。PRISM 在实际上下文长度 (n >= 4K) 下相对于 GPU 基线实现四个数量级的能耗优势。
引用
@article{arxiv.2603.21576,
title = {PRISM: Breaking the O(n) Memory Wall in Long-Context LLM Inference via O(1) Photonic Block Selection},
author = {Hyoseok Park and Yeonsang Park},
journal= {arXiv preprint arXiv:2603.21576},
year = {2026}
}
备注
28 pages, 27 figures, 15 tables, including supplementary material. Code available at https://github.com/hyoseokp/PRISM