通过GPT作为枢纽来缓解非资源语言代码切换数据稀缺性的提示技术
计算与语言
2024-04-29 v1
摘要
许多多语言社区,包括非洲许多地区,经常在对话中进行代码切换。这种行为加剧了能够处理代码切换文本的自然语言处理技术的需求。然而,数据稀缺尤其在非洲语言方面尤为突出,因为许多语言资源较少且缺乏代表。本研究提示GPT 3.5生成阿非利卡语-英语和约鲁巴语-英语的代码切换句子,通过话题关键词对和语言指南等方式增强多样性。我们的发现表明,对于使用非拉丁字符(如约鲁巴语)的语言,生成句子的质量显著低于高阿非利卡语-英语成功率。这表明有显著的机会通过优化提示指南来生成适合语言模型微调的句子。我们提出了一个利用GPT增强人工生成代码切换数据多样性的框架,并提出利用这一技术来缓解低资源语言的数据稀缺性,强调本土语言学家在此过程中的关键作用。
引用
@article{arxiv.2404.17216,
title = {Prompting Towards Alleviating Code-Switched Data Scarcity in Under-Resourced Languages with GPT as a Pivot},
author = {Michelle Terblanche and Kayode Olaleye and Vukosi Marivate},
journal= {arXiv preprint arXiv:2404.17216},
year = {2024}
}
备注
To be published in the Proceedings of SIGUL 2024: 3rd Annual Meeting of the Special Interest Group on Under-resourced Languages