中文

通过深度语境蒸馏训练插即式知识模块

机器学习 2025-08-11 v4 人工智能

摘要

在 (大) 语言模型预训练后动态集成新的或快速变化的信息仍然具有挑战性,特别是在数据有限的情况下或处理私有和专业文档时。In-context learning 和检索增强生成 (RAG) 面临高推理成本以及无法捕获全局文档信息的限制。本文提出一种通过训练文档级别知识模块 (KM) 实现模块化知识的方法。KM 是轻量级组件,实现为参数高效的 LoRA 模块,训练用于存储有关新文档的信息的模块,可按需轻松插入模型。我们展示了 next-token prediction 作为 KM 的训练目标表现不佳。我们另辟蹊径,提出 Deep Context Distillation:我们学习 KM 参数,使其模拟教师模型在获取该文档上下文后的隐藏状态和 logits。我们的方法在两个数据集上超越了标准 next-token prediction 和 pre-instruction training 技术。最后,我们突出 KM 与 RAG 之间的 synergies。

关键词

引用

@article{arxiv.2503.08727,
  title  = {Training Plug-n-Play Knowledge Modules with Deep Context Distillation},
  author = {Lucas Caccia and Alan Ansell and Edoardo Ponti and Ivan Vulić and Alessandro Sordoni},
  journal= {arXiv preprint arXiv:2503.08727},
  year   = {2025}
}

备注

Accepted at the CONFERENCE ON LANGUAGE MODELING (COLM) 2025