用于低资源语言数据增强的生成对抗网络
计算与语言
2025-10-28 v1
摘要
神经机器翻译(NMT)系统在翻译低资源语言时表现不佳,这些语言缺乏大规模数据语料供模型训练使用。由于手动数据整理昂贵且耗时,我们提出利用生成对抗网络(GAN)来增强低资源语言数据。在模拟的低资源环境下使用极少量语言数据(不足20,000句)进行训练时,我们的模型在数据增强方面显示出潜力,生成类似“ask me that healthy lunch im cooking up”以及“my grandfather work harder than your grandfather before”等句子。我们新颖的数据增强方法是首次尝试探讨GAN在低资源NMT中的能力,我们的结果表明GAN在低资源NMT中具有潜力。
引用
@article{arxiv.2409.00071,
title = {Generative-Adversarial Networks for Low-Resource Language Data Augmentation in Machine Translation},
author = {Linda Zeng},
journal= {arXiv preprint arXiv:2409.00071},
year = {2025}
}
备注
8 pages, 4 figures, 4 tables, presented at ICNLP 2024, to be published in IEEE Explore