代码切换合成数据质量的影响取决于任务:来自机器翻译和语音识别的见解
计算与语言
2025-04-01 v1
摘要
代码切换,即在不同语言之间交替,是一种全球范围内普遍存在的现象,需要为构建用户友好的语言技术而加以应对。其主要瓶颈之一是数据稀缺,这推动了代码切换数据增强的研究。然而,当前文献缺乏能够使我们理解合成数据质量与NLP任务改进关系的全面性研究。我们扩展了在机器翻译(MT)上的此类研究,并引入语音识别(ASR)和级联语音翻译(ST)的结果,以测试发现的可推广性。我们的实验涵盖广泛的增强技术,包括词汇替换、语言理论和回译。基于MT、ASR和ST的结果,我们对各种增强技术的有效性以及质量对性能的影响作出结论和见解。
引用
@article{arxiv.2503.23576,
title = {The Impact of Code-switched Synthetic Data Quality is Task Dependent: Insights from MT and ASR},
author = {Injy Hamed and Ngoc Thang Vu and Nizar Habash},
journal= {arXiv preprint arXiv:2503.23576},
year = {2025}
}
备注
Accepted to the Workshop on Computational Approaches to Linguistic Code-Switching (CALCS)