Vividh-ASR:面向健壮印度语语音识别的复杂性分层基准与优化动力学
计算与语言
2026-05-14 v1 人工智能
摘要
微调类似 Whisper 之类的多语言 ASR 模型以适应低资源语言,往往能提高阅读语音性能,但会损害自发语音表现,我们称之为studio-bias。为诊断这一差异,我们引入 Vividh-ASR,一个针对印地语和马拉拉语的复杂性分层基准,涵盖四个层次:studio、broadcast、spontaneous 和synthetic noise。通过学习率时机和课程排序的受控研究,我们发现早期大参数更新可使全局 WER 改善 12 个绝对百分点,而难易课程排序可为自发语音带来额外收益。这些发现催生了逆向多阶段微调(R-MFT)一种训练配方,使 244M 参数的 Whisper 模型能够匹配或超越传统微调的 769M 参数版本。通过 CKA 和 SVD 的表征分析,我们发现有效的训练计划集中于解码器的适应,保留了预训练编码器的声学几何。我们发布了基准数据集和模型。
引用
@article{arxiv.2605.13087,
title = {Vividh-ASR: A Complexity-Tiered Benchmark and Optimization Dynamics for Robust Indic Speech Recognition},
author = {Kush Juvekar and Kavya Manohar and Aditya Srinivas Menon and Arghya Bhattacharya and Kumarmanas Nethil},
journal= {arXiv preprint arXiv:2605.13087},
year = {2026}
}
备注
Submitted to Interspeech 2026