BUFFET:面向少样本跨语言迁移的大语言模型基准测试
计算与语言
2023-05-25 v1
摘要
尽管自然语言处理中的少样本泛化取得了显著进展,大多数模型仍主要在英语上开发与评估。为促进少样本跨语言迁移研究,我们引入名为BUFFET的新基准,其以序列到序列格式统一了54种语言上的15项多样任务,并提供固定的少样本示例与指令。BUFFET旨在为广泛的任务与语言上的少样本跨语言迁移建立严谨且公平的评估框架。利用BUFFET,我们对最先进的多语言大语言模型以不同迁移方法(即上下文学习与微调)进行了透彻评估。我们的发现揭示了少样本上下文跨语言迁移存在显著改进空间。特别是,采用上下文学习的ChatGPT常逊于在英语任务数据与少样本母语示例上微调的更小mT5-base模型。我们的分析指出了少样本跨语言迁移未来研究的多种途径,如改进预训练、理解与未来评估。
引用
@article{arxiv.2305.14857,
title = {BUFFET: Benchmarking Large Language Models for Few-shot Cross-lingual Transfer},
author = {Akari Asai and Sneha Kudugunta and Xinyan Velocity Yu and Terra Blevins and Hila Gonen and Machel Reid and Yulia Tsvetkov and Sebastian Ruder and Hannaneh Hajishirzi},
journal= {arXiv preprint arXiv:2305.14857},
year = {2023}
}
备注
The data and code is available at https://buffetfs.github.io/