低资源语言中LLM数据生成策略的严格评估
计算与语言
2025-09-22 v3
摘要
大型语言模型(LLM)越来越多地被用于生成训练更小专用模型的合成文本数据。然而,针对低资源语言设置的各种生成策略的比较仍然缺乏。虽然已经提出了多种提示策略,如示范、基于标签的摘要和自我修订,但它们的相对有效性尚不明确,尤其是对于低资源语言。在本文中,我们在11种类型多样的语言上系统地评估了这些生成策略及其组合的性能,其中包括几种极低资源语言。使用三种自然语言处理任务和四种开源LLM,我们评估了基于生成数据与基于标准真实数据的下游模型性能。我们的结果表明,生成方法的策略性组合,特别是目标语言示范与基于LLM的修订,在某些设置中将与真实数据的差距缩小到仅5%。我们还发现,智能提示技术可以减小大型LLM的优势,这突显了在低资源场景中使用较小模型进行合成数据生成的高效策略。
引用
@article{arxiv.2506.12158,
title = {A Rigorous Evaluation of LLM Data Generation Strategies for Low-Resource Languages},
author = {Tatiana Anikina and Jan Cegin and Jakub Simko and Simon Ostermann},
journal= {arXiv preprint arXiv:2506.12158},
year = {2025}
}
备注
Accepted to EMNLP 2025 Main