中文

面向地理位置感知的鲁棒口语语言识别

计算与语言 2025-08-26 v1 声音

摘要

尽管自监督学习 (SSL) 显著提高了口语语言识别 (LID),但现有模型常常难以将同一语言的不同方言和方言统一分类为一个类别。为解决这一挑战,我们提出一种基于地理位置感知的 LID 方法,将语言层次的地理位置信息融入 SSL 基于 LID 的模型中。具体而言,我们引入地理位置预测作为一个辅助任务,并将预测向量注入中间表示作为条件信号。这种显式条件化鼓励模型学习更统一的方言和方言变体表示。跨六个多语言数据集的实验表明,我们的方法在鲁棒性和对未知域的适应性方面取得了显著提升,在 FLEURS 上实现了 97.7% 的新 state-of-the-art 准确率,在 ML-SUPERB 2.0 方言数据集上实现了 9.7% 的相对改进。

关键词

引用

@article{arxiv.2508.17148,
  title  = {Geolocation-Aware Robust Spoken Language Identification},
  author = {Qingzheng Wang and Hye-jin Shim and Jiancheng Sun and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2508.17148},
  year   = {2025}
}

备注

Accepted to IEEE ASRU 2025. \c{opyright} 2025 IEEE. Personal use permitted. Permission from IEEE required for all other uses including reprinting/republishing, advertising, resale, redistribution, reuse, or creating collective works