中文

通过可微缓存增强实现潜在空间的推理

计算与语言 2024-12-24 v1 人工智能 机器学习

摘要

使大型语言模型(LLM)能够"思考"通过生成和注意中间推理步骤的技术已显示出解决复杂问题的潜力。然而,标准方法在作出回应前立即生成离散token序列,因此会产生显著的延迟成本且难以优化。在本工作中,我们演示了一个冻结的LLM可以与一个离线协处理器相互作用,该协处理器作用于模型的key-value(kv)缓存。该协处理器通过一组潜在嵌入来增强缓存,以提高后续解码的保真度。我们使用解码器在标准预训练数据上的语言建模损失训练该协处理器,同时保持解码器本身冻结。这种方法使模型能够以端到端可微的方式学习如何将额外计算蒸馏到其kv缓存中。由于解码器保持不变,该协处理器可离线和异步运行,且语言模型在协处理器不可用或给定缓存不需额外计算时可正常工作。我们在实验中表明,当缓存被增强时,解码器在大量后续token上实现更低的perplexity。此外,即使没有任何任务特定训练,我们的实验显示缓存增强在各种推理密集型任务中 consistently 降低perplexity并提高性能。

关键词

引用

@article{arxiv.2412.17747,
  title  = {Deliberation in Latent Space via Differentiable Cache Augmentation},
  author = {Luyang Liu and Jonas Pfeiffer and Jiaxing Wu and Jun Xie and Arthur Szlam},
  journal= {arXiv preprint arXiv:2412.17747},
  year   = {2024}
}