DySK-Attn:基于动态稀疏知识注意力的大型语言模型高效实时知识更新框架
计算与语言
2025-12-30 v3 人工智能
机器学习
摘要
大型语言模型(LLM)存在一个关键限制:其知识是静态的且很快会过时。重新训练这些庞大的模型 computationally prohibitive,而现有的知识编辑技术可能较慢且可能引入意想不到的副作用。为此,我们提出DySK-Attn,一种新框架,使LLM能够高效地整合来自动态外部来源的实时知识。我们的 метод将LLM与可即时更新的动态知识图谱(KG)相结合。我们的框架的核心是稀疏知识注意力机制,允许LLM进行粗到细的分层搜索,高效地识别并聚焦于从庞大的知识库中获取的少量高度相关的事实。该机制避免了对整个知识库进行稠密注意力的高计算成本,并减轻了来自无关信息的噪声。我们通过在时间敏感的问答任务上的大量实验表明,DySK-Attn在事实准确性(针对更新后的知识)和计算效率方面均显著优于强大的基线,包括标准的检索增强生成(RAG)和模型编辑技术。我们的框架为构建能够持续与不断变化的世界保持当前状态的LLM提供了可扩展且有效的解决方案。
引用
@article{arxiv.2508.07185,
title = {DySK-Attn: A Framework for Efficient, Real-Time Knowledge Updating in Large Language Models via Dynamic Sparse Knowledge Attention},
author = {Kabir Khan and Priya Sharma and Arjun Mehta and Neha Gupta and Ravi Narayanan},
journal= {arXiv preprint arXiv:2508.07185},
year = {2025}
}
备注
Preprint; 7 figures, 3 tables, 1 algorithm; v1. Code and data will be released