中文

越南语语音方言变异的语音建模

计算与语言 2026-05-26 v1

摘要

越南语在北部、中部和南部地区表现出显著的方言语音变异,相同的词汇项可能以明显不同的发音实现。这种变异给自动语音识别 (ASR) 带来了挑战,并且由于越南语正字法与音系之间的复杂关系,在计算上对其进行建模仍然困难。现有方法通常在词级别处理方言变异性,假设拼写和发音之间存在方言不变的映射,这限制了它们捕捉系统性语音差异的能力。我们提出了一个方言感知的语音框架,该框架在词汇和解码两个层面显式地建模越南语音系结构和方言变异。该框架引入了一个语音词汇表,将每个音节分解为结构化的语音成分,并将其映射到特定方言的国际音标 (IPA) 表示,同时配备一个语音结构解码器来联合预测这些成分。在 UIT-ViMD——越南语中唯一可用的多方言数据集——上的实验表明,所提出的方法优于各种预训练基线,**尤其是在匹配性能最强的预训练模型 wav2ve2-base-vi-250h 的同时,使用了显著更少的参数且无需外部预训练**。为保证实验可复现性的代码将在本文被接收后公开。

关键词

引用

@article{arxiv.2605.24451,
  title  = {Phonetic Modeling of Dialectal Variation in Vietnamese Speech},
  author = {Quan Ngoc Hoang and Long Hoang Huu Nguyen and Nghia Hieu Nguyen and Kiet Van Nguyen and Ngan Luu-Thuy Nguyen},
  journal= {arXiv preprint arXiv:2605.24451},
  year   = {2026}
}