中文

NIRANTAR:基于真实语音数据的多语言多域持续学习框架

计算与语言 2025-07-02 v1

摘要

我们提出了 Nirantar,一个用于评估多语言和多域语音识别 (ASR) 中持续学习 (CL) 的综合框架。旨在反映真实世界的 CL 挑战,Nirantar 利用自然 episode 收集的印度 22 种语言和 208 个地区的数据,实现 Language-Incremental (LIL)、Domain-Incremental (DIL) 以及 novel Language-Incremental Domain-Incremental Learning (LIDIL) 场景的评估。不同于依赖仿真 episode 的先前工作,Nirantar 提供动态、非均匀的语言和域变化,使其成为 CL 研究的理想基准。该框架包含 3250 小时的人工转录语音,其中 1720 小时为本工作新引入。我们评估了现有方法,证明没有单一方法在所有情形下都表现出色,凸显了需要更稳健 CL 策略的重要性。

关键词

引用

@article{arxiv.2507.00534,
  title  = {NIRANTAR: Continual Learning with New Languages and Domains on Real-world Speech Data},
  author = {Tahir Javed and Kaushal Bhogale and Mitesh M. Khapra},
  journal= {arXiv preprint arXiv:2507.00534},
  year   = {2025}
}

备注

Accepted in Interspecch 2025