中文

我们是否应以检索预训练自回归语言模型?一项综合研究

计算与语言 2023-12-22 v3 人工智能 信息检索 机器学习

摘要

大型仅解码器语言模型(LM)可通过检索(如 RETRO)在困惑度上大幅改进,但其对文本生成质量和下游任务精度的影响尚不清楚。因此,是否应以检索预训练大型自回归 LM 仍是一个开放问题。为回答该问题,我们对可扩展的预训练检索增强 LM(即 RETRO)与标准 GPT 以及在微调或推理阶段引入检索增强的 GPT 进行了综合研究。我们首先给出了将 RETRO 复现至 9.5B 参数同时从含 330B token 的文本语料检索的配方。基于此,我们有以下新发现:i) RETRO 在文本生成上优于 GPT,退化(即重复)少得多,事实准确性中等程度更高,且在无毒检索数据库下毒性略低。ii) 在 LM Evaluation Harness 基准上,RETRO 在知识密集型任务上大幅优于 GPT,但在其他任务上与 GPT 相当。此外,我们引入了模型的一个简单变体 RETRO++,其大幅改进了原始 RETRO 的开放域 QA 结果(例如 Natural Question 上 EM 分数 +8.6),并在微调和零样本评估设置下均显著优于检索增强 GPT。我们的发现凸显了以检索预训练自回归 LM 作为未来基础模型这一有前景的方向。我们在 https://github.com/NVIDIA/Megatron-LM/blob/main/tools/retro/README.md 发布了代码与模型。

关键词

引用

@article{arxiv.2304.06762,
  title  = {Shall We Pretrain Autoregressive Language Models with Retrieval? A Comprehensive Study},
  author = {Boxin Wang and Wei Ping and Peng Xu and Lawrence McAfee and Zihan Liu and Mohammad Shoeybi and Yi Dong and Oleksii Kuchaiev and Bo Li and Chaowei Xiao and Anima Anandkumar and Bryan Catanzaro},
  journal= {arXiv preprint arXiv:2304.06762},
  year   = {2023}
}

备注

EMNLP 2023