利用侧车分离器统一建模多说话人重叠语音识别与说话人日志
声音
2023-05-26 v1 人工智能
计算与语言
机器学习
音频与语音处理
摘要
多说话人重叠语音对语音识别和说话人日志(diarization)构成重大挑战。近期研究表明这两项任务相互依赖且互补,促使我们探索一种统一建模方法在重叠语音场景下解决它们。一项近期研究提出了一种经济有效的方法,通过将侧车(Sidecar)分离器插入冻结的预训练良好的单说话人自动语音识别(ASR)系统,将其转化为多说话人系统。在此基础上,我们将一个说话人日志分支整合进侧车中,从而以仅 768 个参数的可忽略开销实现对 ASR 和说话人日志的统一建模。所提方法在 LibriMix 和 LibriSpeechMix 数据集上相比基线取得了更好的 ASR 结果。此外,无需对说话人日志任务进行复杂定制,我们的方法在 CALLHOME 的双说话人子集上仅通过少量自适应步骤即取得了可接受的说话人日志结果。
引用
@article{arxiv.2305.16263,
title = {Unified Modeling of Multi-Talker Overlapped Speech Recognition and Diarization with a Sidecar Separator},
author = {Lingwei Meng and Jiawen Kang and Mingyu Cui and Haibin Wu and Xixin Wu and Helen Meng},
journal= {arXiv preprint arXiv:2305.16263},
year = {2023}
}
备注
Accepted to INTERSPEECH 2023