利用 GPT-3.5 为极度资源匮乏语言进行数据到文本生成:来自谷歌翻译的一点帮助
计算与语言
2023-08-22 v1 人工智能
摘要
像 GPT 这样的 LLM 在其训练数据中占主导地位的英语相关任务上表现出色。在本文中,我们考察了它们在训练数据中代表性极低的语言相关任务上的表现,具体场景为爱尔兰语、马耳他语、威尔士语和布列塔尼语的数据到文本生成。在提示工程阶段,我们在 GPT-3.5 和 4 上使用少量示例输入/输出对测试了一系列提示类型和格式。随后我们在两种场景下对两种最有前景的提示进行了完整评估:(i) 直接生成目标资源匮乏语言,以及 (ii) 先生成英语再翻译为资源匮乏语言。我们发现少样本提示在直接生成资源匮乏语言时效果更好,但当通过英语中转时该差异消失。少样本+翻译的系统变体提交至 WebNLG 2023 共享任务,在所有语言的所有指标上均以大幅优势超越竞争对手系统。我们得出结论,利用最先进的 LLM 开箱即用即可在资源匮乏语言上取得良好表现。然而,我们的最佳结果(威尔士语)仍远低于 WebNLG'20 中排名最低的英语系统。
引用
@article{arxiv.2308.09957,
title = {Data-to-text Generation for Severely Under-Resourced Languages with GPT-3.5: A Bit of Help Needed from Google Translate},
author = {Michela Lorandi and Anya Belz},
journal= {arXiv preprint arXiv:2308.09957},
year = {2023}
}