中文

APE:通过自适应并行编码实现更快、更长的上下文增强生成

机器学习 2025-02-13 v2 人工智能

摘要

上下文增强生成(CAG)技术,包括RAG和ICL,需要高效地组合多个上下文以生成对用户查询的响应。直接将这些上下文作为序列输入会通过为每个请求重新编码组合上下文选择而引入相当大的计算负担。为解决这一问题,我们探索了并行编码的有前景潜力,以独立地预计算和缓存每个上下文的KV状态。该方法允许在推理期间直接加载缓存状态,同时通过跨上下文的位置复用来容纳更多上下文。然而,由于注意力分布的不对齐,直接应用并行编码会导致显著的性能下降。为实现有效且高效的CAG,我们提出了自适应并行编码(APE),它通过共享前缀、注意力温度和缩放因子来对齐并行编码与顺序编码的分布。RAG和ICL任务上的结果表明,APE可以使用相同输入保留98%和93%的顺序编码性能,同时分别优于并行编码3.6%和7.9%。它还可以扩展到多样本CAG,有效地并行编码数百个上下文。效率评估表明,APE可以通过减少128K长度上下文的28×预填充时间,实现端到端4.5×的加速。

关键词

引用

@article{arxiv.2502.05431,
  title  = {APE: Faster and Longer Context-Augmented Generation via Adaptive Parallel Encoding},
  author = {Xinyu Yang and Tianqi Chen and Beidi Chen},
  journal= {arXiv preprint arXiv:2502.05431},
  year   = {2025}
}

备注

ICLR 2025