使用声学伪令牌预测正迁移以改进低资源语音识别
音频与语音处理
2024-02-06 v1 计算与语言
摘要
虽然像 wav2vec 2.0 XLSR-128 这样的大规模多语言语音模型可以直接微调用于自动语音识别(Automatic Speech Recognition, ASR),但在预训练数据中代表性不足的语言上,下游性能仍然可能相对较差。在这些语言上对 70-200 小时的未转录语音进行持续预训练会有所帮助——但如果没有那么多录制数据的语言该怎么办?对于这种情况,我们表明,用来自相似的高资源“捐赠者”语言的数据补充目标语言会有所帮助。例如,在仅 10 小时低资源旁遮普语 supplemented with 60 小时捐赠者印地语上进行持续预训练,几乎与在 70 小时旁遮普语上持续预训练一样好。相比之下,从孟加拉语等相似度较低的捐赠者那里获取数据并不能改善 ASR 性能。为了给捐赠者语言选择提供依据,我们提出了一种基于诱导声学单元序列分布的新颖相似度度量:声学令牌分布相似度(Acoustic Token Distribution Similarity, ATDS)。在一组类型不同的目标语言(旁遮普语、加利西亚语、伊班语、塞茨瓦纳语)上,我们表明目标语言与其候选捐赠者之间的 ATDS 能够精确预测目标语言的 ASR 性能。
引用
@article{arxiv.2402.02302,
title = {Predicting positive transfer for improved low-resource speech recognition using acoustic pseudo-tokens},
author = {Nay San and Georgios Paraskevopoulos and Aryaman Arora and Xiluo He and Prabhjot Kaur and Oliver Adams and Dan Jurafsky},
journal= {arXiv preprint arXiv:2402.02302},
year = {2024}
}
备注
Accepted for SIGTYP2024