GPT 与 RETRO:检索与参数高效微调的交汇
计算与语言
2024-10-28 v4 人工智能
信息检索
机器学习
摘要
参数高效微调(PEFT)和检索增强生成(RAG)已成为在最小化计算需求的同时调整大型语言模型的流行方法。本文将 PEFT 方法(P-tuning、Adapter 和 LoRA)应用于修改后的检索增强变换器(RETRO)以及基线 GPT 模型,模型参数规模从8.23亿到480亿不等。我们表明,RETRO 模型因其独特的预训练过程在零样例设置下优于 GPT 模型,但 GPT 模型在 PEFT 上具有更高的性能潜力。此外,我们的研究表明,8B 参数模型在成本与性能之间达到最佳平衡,P-tuning 在其他 PEFT 技术之外显得滞后。我们进一步提供了将 PEFT 应用于指令调优 RETRO 模型与基准 RETRO 模型之间进行比较分析。这项工作提出了将各种 PEFT 方法与 RAG 集成并应用于 GPT 和 RETRO 模型的首个全面比较,凸显了它们的相对性能。
引用
@article{arxiv.2407.04528,
title = {GPT vs RETRO: Exploring the Intersection of Retrieval and Parameter-Efficient Fine-Tuning},
author = {Aleksander Ficek and Jiaqi Zeng and Oleksii Kuchaiev},
journal= {arXiv preprint arXiv:2407.04528},
year = {2024}
}
备注
EMNLP 2024