LLM能否生成文化相关的常识问答数据?以印尼语和巽他语为例
计算与语言
2024-10-08 v3
摘要
大型语言模型(LLM)越来越多地被用于生成合成数据以训练和评估模型。然而,目前尚不清楚它们能否生成高质量且融入语言中知识和文化细微差别的问答(QA)数据集,尤其是对于低资源语言。在本研究中,我们调查了使用LLM为印尼语和巽他语生成文化相关常识QA数据集的有效性。为此,我们通过涉及LLM和人工标注者的多种方法为这些语言创建了数据集,每种语言约4500个问题(总计约9000个),使我们的数据集成为同类中最大的。实验表明,从现有英文数据集进行自动数据适配对巽他语效果较差。有趣的是,使用目标语言的直接生成方法,GPT-4 Turbo能够生成具有足够通用知识的问题,尽管在文化“深度”上不如人类。我们还观察到巽他语数据集中流利性错误的发生率更高,凸显了中等资源语言与低资源语言之间的差异。
引用
@article{arxiv.2402.17302,
title = {Can LLM Generate Culturally Relevant Commonsense QA Data? Case Study in Indonesian and Sundanese},
author = {Rifki Afina Putri and Faiz Ghifari Haznitrama and Dea Adhista and Alice Oh},
journal= {arXiv preprint arXiv:2402.17302},
year = {2024}
}
备注
EMNLP 2024 Camera-Ready