中文

ViDia2Std:面向低资源越南方言到标准语翻译的平行语料与方法

计算与语言 2026-03-12 v1

摘要

越南语存在着广泛的方言变异,这给主要以标准越南语训练的 NLP 系统带来了挑战。这些系统在处理来自后劳旁和南部地区特别是边缘化地区的方言输入时往往表现不佳。以中心方言向北方方言转换为主题的先前工作仅使用合成数据和有限的方言多样性,且仅限于北部地区。我们引入 ViDia2Std,这是第一个覆盖所有 63 个省份的方言到标准越南语平行语料库。与先前数据集不同,ViDia2Std 包含来自中心、南部以及常被现有资源遗漏的非标准北部地区的多样化方言,堪称目前最具方言包容性的数据集。该数据集由来自现实 Facebook 评论的超过 13000 句句对组成,由来自三个方言地区的母语者进行注释。为评估注释一致性,我们定义一种语义映射一致性度量标准,该标准考虑到注释者之间对同义标准映射的一致性。根据此标准,我们报告了北部 86%、中心部 82% 和南部 85% 的一致性率。我们在 ViDia2Std 上对几种序列到序列模型进行基准测试。mBART-large-50 实现了最佳结果(BLEU 为 0.8166,ROUGE-L 为 0.9384,METEOR 为 0.8925),而 ViT5-base 在参数更少的情况下也能实现可竞争的性能。ViDia2Std 表明,方言规范化在下游任务中显著提升了性能,凸显了在构建健壮的越南语 NLP 系统中需要方言感知资源的重要性。

关键词

引用

@article{arxiv.2603.10211,
  title  = {ViDia2Std: A Parallel Corpus and Methods for Low-Resource Vietnamese Dialect-to-Standard Translation},
  author = {Khoa Anh Ta and Nguyen Van Dinh and Kiet Van Nguyen},
  journal= {arXiv preprint arXiv:2603.10211},
  year   = {2026}
}

备注

Accepted to AAAI-26 (Oral)