中文

唤醒增强生成:学习唤醒大语言模型内部知识以用于问答

计算与语言 2024-12-17 v5

摘要

检索增强生成和生成增强生成已被提出,通过利用更丰富的上下文来增强大语言模型(LLM)问答所需的知识。然而,前者依赖外部资源,且两者都需要将显式文档纳入上下文,这增加了执行成本和推理过程中对噪声数据的敏感性。近期研究表明,LLM 建模了丰富的知识,但这些知识往往未被有效激活和唤醒。受此启发,我们提出了一种新颖的知识增强框架,即唤醒增强生成(AAG),它模仿人类仅通过思考和回忆来回答问题以弥补知识差距的能力,从而在不依赖外部资源的情况下唤醒 LLM 中的相关知识。AAG 包含两个用于唤醒更丰富上下文的关键组件。显式唤醒微调一个上下文生成器,以创建一个作为符号上下文的合成压缩文档。隐式唤醒利用超网络基于问题和合成文档生成适配器,这些适配器被插入 LLM 中以充当参数上下文。在三个数据集上的实验结果表明,AAG 在开放域和闭卷设置以及分布外泛化方面均表现出显著优势。我们的代码将可在 https://github.com/Xnhyacinth/IAG 获取。

关键词

引用

@article{arxiv.2403.15268,
  title  = {Awakening Augmented Generation: Learning to Awaken Internal Knowledge of Large Language Models for Question Answering},
  author = {Huanxuan Liao and Shizhu He and Yao Xu and Yuanzhe Zhang and Kang Liu and Shengping Liu and Jun Zhao},
  journal= {arXiv preprint arXiv:2403.15268},
  year   = {2024}
}

备注

Accepted to COLING 2025