中文

InstructRetro:检索增强预训练后的指令微调

计算与语言 2024-05-30 v3 人工智能 信息检索 机器学习

摘要

通过检索对自回归大语言模型(LLMs)进行预训练,可利用外部数据库展现出更好的困惑度和事实准确性。然而,现有预训练检索增强LLM的规模仍有限(如Retro有7.5B参数),这限制了指令微调和零样本泛化的效果。本工作中,我们引入Retro 48B,即最大的检索预训练LLM。具体而言,我们使用Retro增强方法,从1.2万亿词元中检索,对43B GPT模型在额外1000亿词元上继续预训练。值得注意的是,所得基础模型Retro 48B仅用2.58%的额外GPU小时即在困惑度上大幅超越在1.2T词元上训练的对应GPT 43B,展示了该方法显著的扩展潜力。在Retro上指令微调后,InstructRetro在广泛零样本任务上较指令微调GPT有显著提升。具体而言,在8个短式问答和阅读理解任务上InstructRetro平均较其GPT对应模型提升7%,在4个具挑战性长式问答任务上较GPT提升10%,在3个摘要任务上较GPT提升16%。令人惊讶的是,我们发现可从InstructRetro架构中去掉编码器并直接使用其解码器主干,同时取得可比结果。我们的结果凸显了在指令微调前通过检索继续预训练获得更优GPT解码器的有前景方向。我们的代码和检查点公开于:https://huggingface.co/nvidia/retro-48b-instruct-4k。

关键词

引用

@article{arxiv.2310.07713,
  title  = {InstructRetro: Instruction Tuning post Retrieval-Augmented Pretraining},
  author = {Boxin Wang and Wei Ping and Lawrence McAfee and Peng Xu and Bo Li and Mohammad Shoeybi and Bryan Catanzaro},
  journal= {arXiv preprint arXiv:2310.07713},
  year   = {2024}
}

备注

ICML 2024