中文

探索训练专家语言模型相对于指令微调的优势

计算与语言 2023-02-10 v2

摘要

近来,在多个任务上指令微调的语言模型(LMs),亦称多任务提示微调(MT),已展现出泛化至未见任务的能力。先前工作表明,扩大训练任务数量是造就更强 MT LMs 的关键。本工作中,我们报告一项意外发现:仅在单一任务上微调的专家 LM,在 11 个不同未见数据集及 BIG-bench 基准的 13 个数据集上,分别以平均准确率高出 3.20% 与 1.29% 优于用 300+ 不同任务训练的 MT LM。该发现对先前“仅扩大任务数量即可造就更强 MT LMs”的认知提出质疑。利用此发现,我们进一步表明,这种为每个训练任务训练独立专家 LM 而非单一 MT LM 用于零样本推断的分布式方法具备诸多优势,包括(1)避免指令微调中常发生的负任务迁移,(2)能够持续学习新任务而无需在先前任务上重训以规避灾难性遗忘,(3)在合并各专家时展现组合能力。代码见 https://github.com/joeljang/ELM。

关键词

引用

@article{arxiv.2302.03202,
  title  = {Exploring the Benefits of Training Expert Language Models over Instruction Tuning},
  author = {Joel Jang and Seungone Kim and Seonghyeon Ye and Doyoung Kim and Lajanugen Logeswaran and Moontae Lee and Kyungjae Lee and Minjoon Seo},
  journal= {arXiv preprint arXiv:2302.03202},
  year   = {2023}
}