中文

ViMedCSS:越南医疗代码切换语音数据集与基准

计算与语言 2026-02-16 v1

摘要

代码切换(Code-switching, CS),即越南语语音中夹杂英语单词(如药名或程序名称),是越南医疗沟通中常见现象。这给自动语音识别(Automatic Speech Recognition, ASR)系统带来挑战,尤其是资源匮乏的语言如越南语。当前大多数ASR系统难以正确识别越南语句子中夹杂的英语医学术语,且尚无基准数据集针对这一挑战。本文构建了一个34小时的​​越南​​医​疗​代码​切换​语​音​数据​集(ViMedCSS),包含16,576​个​ utterance。每个 utterance 至少包含一个来自涵盖五大医疗主题的精选双语词典中的英语医学术语。基于该数据集,我们评估了多个最新ASR模型,探讨了不同细化策略以提升医学术语识别效果,以寻找解决该数据集挑战的最佳方法。实验结果表明,针对越南语优化的模型在通用段落表现更佳,而多语言预训练有助于捕捉英语插入内容。两者结合可在整体准确率和代码切换准确率之间实现最佳平衡。本工作提供了越南医疗代码切换的首个基准,并为低资源、多语言ASR系统的有效领域适应提供了见解。

关键词

引用

@article{arxiv.2602.12911,
  title  = {ViMedCSS: A Vietnamese Medical Code-Switching Speech Dataset & Benchmark},
  author = {Tung X. Nguyen and Nhu Vo and Giang-Son Nguyen and Duy Mai Hoang and Chien Dinh Huynh and Inigo Jauregi Unanue and Massimo Piccardi and Wray Buntine and Dung D. Le},
  journal= {arXiv preprint arXiv:2602.12911},
  year   = {2026}
}

备注

Accepted at LREC 2026