中文

指令微调语言模型是更优的知识学习者

计算与语言 2024-05-28 v2 人工智能 机器学习

摘要

为了使基于大语言模型(LLM)的助手能够有效适应不断变化的信息需求,必须能够通过在新数据上进行持续训练来更新其事实性知识。执行此操作的标准流程包括在新文档上进行持续预训练,随后在问答(QA)对上进行指令微调。然而,我们发现采用此流程训练的 LLM 难以回答问题,尽管文档的困惑度已最小化。我们发现 QA 对通常较为直接,而文档则更为复杂,以错综复杂的方式交织了许多事实陈述。因此,我们假设在针对文档进行持续预训练之前,让 LLM 接触 QA 对是有益的,这样从复杂文档中编码知识的过程就能考虑到如何通过问题来访问这些知识。基于此,我们提出了预指令微调(pre-instruction-tuning, PIT)方法,即在针对文档训练之前先进行指令微调。这与标准指令微调形成对比,后者是在针对文档训练之后学习如何提取知识。大量的实验和消融研究表明,预指令微调显著增强了 LLM 从新文档中吸收知识的能力,其表现优于标准指令微调 17.8%。

关键词

引用

@article{arxiv.2402.12847,
  title  = {Instruction-tuned Language Models are Better Knowledge Learners},
  author = {Zhengbao Jiang and Zhiqing Sun and Weijia Shi and Pedro Rodriguez and Chunting Zhou and Graham Neubig and Xi Victoria Lin and Wen-tau Yih and Srinivasan Iyer},
  journal= {arXiv preprint arXiv:2402.12847},
  year   = {2024}
}

备注

ACL 2024. The reproduced data for this paper is available at https://github.com/Edward-Sun/PIT