基于大语言模型的数据增强以提升跨语言性能
计算与语言
2023-10-24 v2
摘要
本文探讨了在多语言常识推理数据集中利用大语言模型(LLMs)进行数据增强的潜力,此类数据集的可用训练数据极为有限。为此,我们使用多个LLM(即Dolly-v2、StableVicuna、ChatGPT和GPT-4)来增强三个数据集:XCOPA、XWinograd和XStoryCloze。随后,我们评估了使用合成数据微调较小的多语言模型mBERT和XLMR的有效性。我们比较了使用英语生成数据、目标语言生成数据以及翻译的英语生成数据进行训练的性能,揭示了引入LLM生成数据的整体优势,例如最佳情况下准确率显著提升13.4分。此外,我们通过邀请母语者评估不同语言生成样本的自然度和逻辑连贯性进行了人工评价。评价结果表明,ChatGPT和GPT-4等LLM在大多数语言中擅长生成自然且连贯的文本,但在泰米尔语等某些语言上难以生成有意义的文本。我们还观察到,与原数据集相比,ChatGPT在生成合理替代项方面存在不足,而GPT-4生成的样本展现出具有竞争力的逻辑一致性。
引用
@article{arxiv.2305.14288,
title = {LLM-powered Data Augmentation for Enhanced Cross-lingual Performance},
author = {Chenxi Whitehouse and Monojit Choudhury and Alham Fikri Aji},
journal= {arXiv preprint arXiv:2305.14288},
year = {2023}
}
备注
EMNLP 2023 Main Conference