中文

Dolphin-CN-Dialect: 当汉语方言至关重要时

计算与语言 2026-05-12 v1 音频与语音处理

摘要

我们提出了 Dolphin-CN-Dialect,一个专注于中文及丰富方言场景的、支持流式处理的自动语音识别(ASR)模型。与先前版本相比,Dolphin-CN-Dialect 在数据处理、分词、训练稳定性和数据采样策略方面引入了实质性改进。为应对高度不平衡的方言数据带来的挑战,我们提出了一种基于温度的采样策略,该策略有效平衡了标准普通话和低资源方言,从而在方言识别性能上取得了显著提升。此外,我们重新设计了分词器以更好地对齐语言特性,对中文采用字符级建模,对英文采用子词建模,同时引入了可扩展的方言标记。实验结果表明,与 Dolphin 相比,Dolphin-CN-Dialect 在方言识别准确率和字符错误率(CER)降低方面均取得了改进。此外,Dolphin-CN-Dialect 在保持显著更小模型尺寸的同时,达到了与近期 SOTA 开源 ASR 模型相竞争的性能。Dolphin-CN-Dialect 支持流式和非流式推理,实现了延迟与准确性之间的实际平衡。它还通过热词支持提供灵活的定制化,并针对专用硬件进行了高效部署优化。这些改进使 Dolphin-CN-Dialect 成为面向真实世界多方言 ASR 应用的强大且实用的解决方案。

关键词

引用

@article{arxiv.2605.08961,
  title  = {Dolphin-CN-Dialect: Where Chinese Dialects Matter},
  author = {Yangyang Meng and Huihang Zhong and Guodong Lin and Guanbo Wang and Hu Du and Zhiming Shao and Yukai Huang and Ke Li and Wei-Qiang Zhang},
  journal= {arXiv preprint arXiv:2605.08961},
  year   = {2026}
}