基于Clip-level声学相似性的跨语言数据选择用于提升低资源自动语音识别
音频与语音处理
2025-06-30 v1
摘要
本文提出了一种新颖的捐献数据选择方法,用于提升低资源自动语音识别(ASR)性能。尽管ASR在高资源语言上表现良好,但在低资源环境下由于训练数据有限,准确率会下降。常见的解决方案是利用带有捐献语言的多语言自监督学习(SSL)模型。然而,现有方法依赖于语言层面的相似性,忽略了Clip级别的变异。为此,我们提出了基于声学标记分布相似性的Clip级选择方法(CATDS),该方法识别与目标语言更具声学关联性的捐献Clip,以实现更好的对齐。与现有Clip级选择方法不同,我们的方法与SSL模型的表示方式一致,提供更具挑战性但更有价值的样本。实验结果表明,CATDS优于传统选择方法,甚至可以利用此前被视为有害的捐献语言。
引用
@article{arxiv.2506.22194,
title = {Cross-lingual Data Selection Using Clip-level Acoustic Similarity for Enhancing Low-resource Automatic Speech Recognition},
author = {Shunsuke Mitsumori and Sara Kashiwagi and Keitaro Tanaka and Shigeo Morishima},
journal= {arXiv preprint arXiv:2506.22194},
year = {2025}
}
备注
Accepted at INTERSPEECH 2025