中文

基于解码器的多语言模型跨语言提示微调的分析

计算与语言 2023-11-15 v1

摘要

多语言模型领域一个令人振奋的进展是具有零样本和少样本能力的自回归模型的出现,这一现象在大规模语言模型中被广泛报道。为了进一步改善模型对跨语言任务的适配,另一趋势是通过全量微调或参数高效微调进一步微调语言模型。然而,参数高效微调(PEFT)与多语言自回归模型中跨语言任务之间的相互作用尚待研究。具体而言,我们缺乏对在多语言模型中基于令牌的提示微调有效性方面语言分布作用的理解。为解答该问题,我们在基于解码器的多语言模型XGLM上,使用四项跨语言任务(XNLI、PAWS-X、POS、NER)比较了提示微调与微调。根据我们的研究,提示微调在所有语言上取得与微调相当或更好的性能,同时最多更新0.13%的模型参数。此外,我们经验性地表明提示微调在提升低资源语言性能方面比微调更有效。我们的进一步分析显示该现象与多语言模型的分词方案有关。

关键词

引用

@article{arxiv.2311.07820,
  title  = {On the Analysis of Cross-Lingual Prompt Tuning for Decoder-based Multilingual Model},
  author = {Nohil Park and Joonsuk Park and Kang Min Yoo and Sungroh Yoon},
  journal= {arXiv preprint arXiv:2311.07820},
  year   = {2023}
}