中文

SR-KI:通过监督注意力将可扩展且实时的知识集成到大语言模型中

计算与语言 2025-11-11 v1 人工智能

摘要

本文提出了SR-KI(Scalable and Real-Time Knowledge Integration),一种用于将实时且大规模结构化知识库(KB)集成到大语言模型(LLM)中的新方法。SR-KI首先通过预训练编码器将知识库编码为键值对,并将其注入LLM的键值缓存中。基于这种表示,我们采用两阶段训练范式:首先在LLM中定位专用检索层,然后在该层上应用基于注意力的损失,以显式监督注意力聚焦于相关知识库条目。不同于依赖外部检索器性能并依赖多阶段管道的传统检索增强生成方法,SR-KI支持端到端推理,通过在模型潜在空间内执行检索来实现。这一设计使注入的知识能够高效压缩,并支持动态知识更新。全面实验表明,SR-KI能够在单张A100 40GB GPU上将最高达40K条知识库条目集成到7B LLM中,并在最佳任务上实现超过98%的Recall@10,平均水平超过88%。问答任务和知识库ID生成任务的性能也表明,SR-KI在实现注入知识压缩率达99.75%的同时仍保持强大的性能。

关键词

引用

@article{arxiv.2511.06446,
  title  = {SR-KI: Scalable and Real-Time Knowledge Integration into LLMs via Supervised Attention},
  author = {Bohan Yu and Wei Huang and Kang Liu},
  journal= {arXiv preprint arXiv:2511.06446},
  year   = {2025}
}

备注

Accepted by AAAI 2026