来源感知训练使语言模型具备知识归因能力
计算与语言
2024-08-14 v3 人工智能
摘要
大型语言模型(LLMs)在预训练期间学习了大量知识,但它们往往对这些知识的来源一无所知。我们研究了内在来源引用问题,即要求LLMs引用支持生成响应的预训练来源。内在来源引用可以增强LLM的透明度、可解释性和可验证性。为了赋予LLMs这种能力,我们探索了来源感知训练——一种包含以下步骤的方案: 训练LLM将唯一的源文档标识符与每个文档中的知识相关联,随后进行 指令微调阶段,教导LLM在收到提示时引用支持性的预训练来源。来源感知训练借鉴了现有的预训练/微调框架,并且只需对模型架构或实现进行最少的更改。通过对合成数据的实验,我们证明了与标准预训练相比,我们的训练方案能够实现对预训练数据的忠实归因,而不会对模型的困惑度产生重大影响。我们的发现还强调了预训练数据增强在实现归因中的重要性。代码和数据可在此处获取:\url{https://github.com/mukhal/intrinsic-source-citation}
引用
@article{arxiv.2404.01019,
title = {Source-Aware Training Enables Knowledge Attribution in Language Models},
author = {Muhammad Khalifa and David Wadden and Emma Strubell and Honglak Lee and Lu Wang and Iz Beltagy and Hao Peng},
journal= {arXiv preprint arXiv:2404.01019},
year = {2024}
}
备注
COLM '24