提示多语言大语言模型生成码混文本:以东南亚语言为例
计算与语言
2023-09-13 v4 人工智能
摘要
尽管码混在世界许多地区是一种常见的语言实践,但收集高质量且低成本的码混数据仍是自然语言处理(NLP)研究的一个挑战。近期大语言模型(LLMs)的激增促使人们发问:这些系统生成码混数据的能力如何?在本文中,我们探索以零样本方式提示多语言LLMs为东南亚(SEA)七种语言生成码混数据,即印尼语、马来语、汉语、他加禄语、越南语、泰米尔语和新加坡英语。我们发现公开可用的多语言指令微调模型如BLOOMZ和Flan-T5-XXL无法产生含有来自不同语言的短语或从句的文本。ChatGPT在生成码混文本方面表现出不一致的能力,其性能取决于提示模板和语言配对。例如,ChatGPT生成流畅自然的新加坡英语文本(新加坡使用的基于英语的克里奥尔语),但对于英语-泰米尔语配对,该系统大多产生语法错误或无语义意义的话语。此外,它可能错误地引入提示中未指定的语言。基于我们的调查,现有多语言LLMs在东南亚语言码混数据生成方面表现出广泛的能力差异。因此,我们建议在此类情形下使用LLMs时需经过大量人工核查。
引用
@article{arxiv.2303.13592,
title = {Prompting Multilingual Large Language Models to Generate Code-Mixed Texts: The Case of South East Asian Languages},
author = {Zheng-Xin Yong and Ruochen Zhang and Jessica Zosa Forde and Skyler Wang and Arjun Subramonian and Holy Lovenia and Samuel Cahyawijaya and Genta Indra Winata and Lintang Sutawika and Jan Christian Blaise Cruz and Yin Lin Tan and Long Phan and Rowena Garcia and Thamar Solorio and Alham Fikri Aji},
journal= {arXiv preprint arXiv:2303.13592},
year = {2023}
}
备注
Updating Authors