USM-SCD:基于大型预训练基础模型的多语言说话人变更检测
音频与语音处理
2024-01-09 v3 机器学习
声音
摘要
我们介绍了一种多语言说话人变更检测模型(USM-SCD),可同时检测说话人转换并对 96 种语言执行 ASR。该模型改编自一个在大量监督与无监督数据上训练的语音基础模型,展示了从大型通用基础模型微调以用于下游任务的效用。我们通过一系列消融研究分析了该多语言说话人变更检测模型的性能。我们表明,USM-SCD 模型在由 96 种语言数据组成的测试集上可实现超过 75% 的平均说话人变更检测 F1 分数。在美式英语上,USM-SCD 模型在各种公开和内部测试集上可实现 85.8% 的说话人变更检测 F1 分数,相对优于先前的单语基线模型 21%。我们还表明,我们仅需微调可训练模型参数的四分之一即可达到最佳模型性能。USM-SCD 模型相比强大的公开 ASR 基线展现出最先进的 ASR 质量,使其适合以可忽略的额外计算成本处理两项任务。
引用
@article{arxiv.2309.08023,
title = {USM-SCD: Multilingual Speaker Change Detection Based on Large Pretrained Foundation Models},
author = {Guanlong Zhao and Yongqiang Wang and Jason Pelecanos and Yu Zhang and Hank Liao and Yiling Huang and Han Lu and Quan Wang},
journal= {arXiv preprint arXiv:2309.08023},
year = {2024}
}
备注
5 pages, 2 figures, 4 tables