单语还是多语指令微调:哪种造就更好的 Alpaca
计算与语言
2024-02-01 v2 人工智能
摘要
基础大语言模型(LLMs)可通过指令微调来执行开放域问答,从而支持聊天助手等应用。尽管此类工作常以单一语言开展,我们实证分析了面向多语言场景的、具成本效益的策略。我们的研究使用 Alpaca 数据集及其机器翻译以构成多语言数据,随后通过低秩适配或全参数训练将 LLM 微调。在受控计算预算下,比较显示多语言微调与为每种语言单独微调相当或更优。此外,采用下采样数据的多语言微调可同样有效且更鲁棒。我们的发现可作为通过指令微调扩展语言支持的指南。
引用
@article{arxiv.2309.08958,
title = {Monolingual or Multilingual Instruction Tuning: Which Makes a Better Alpaca},
author = {Pinzhen Chen and Shaoxiong Ji and Nikolay Bogoychev and Andrey Kutuzov and Barry Haddow and Kenneth Heafield},
journal= {arXiv preprint arXiv:2309.08958},
year = {2024}
}
备注
Accepted to Findings of ACL: EACL 2024. Added human evaluation and shortened writing