中文

PICASO:基于状态空间模型的排列不变上下文组合

计算与语言 2025-03-18 v2 人工智能 机器学习

摘要

为大型语言模型在推理时提供相关上下文知识已被证明可显著提升其生成质量。这通常通过检索外部知识库中的信息性文本段落(即“上下文”)并拼接到输入中来实现。然而,实时处理额外的上下文会随其长度显著增加计算成本。状态空间模型(SSMs)提供了一条可行方案,允许将上下文数据库映射到固定维度的状态,以此作为生成的起点。关键挑战在于如何利用跨多个上下文中所含信息,因现有 SSMs 无法直接在多个独立状态上进行条件生成。为此,我们利用源自 SSM 动力学的数学关系,将多个状态组合为一个能高效近似拼接原始上下文标记效果的状态。由于上下文的时序排列往往无关紧要,我们通过在所有可能的上下文排列顺序上对通过组合算法获得的状态进行平均,以实现排列不变性。我们在 WikiText 和 MSMARCO 上进行评估,分别在零样本和微调设置下测试,结果表明该方法可在保持 5.4 倍平均加速的同时,匹配最强基线的性能。

关键词

引用

@article{arxiv.2502.17605,
  title  = {PICASO: Permutation-Invariant Context Composition with State Space Models},
  author = {Tian Yu Liu and Alessandro Achille and Matthew Trager and Aditya Golatkar and Luca Zancato and Stefano Soatto},
  journal= {arXiv preprint arXiv:2502.17605},
  year   = {2025}
}

备注

Published in The Thirteenth International Conference on Learning Representations, ICLR 2025