DiCoW:面向目标说话人的自动语音识别的说话人分割条件 Whisper
音频与语音处理
2025-01-03 v1 声音
摘要
多说话人环境下的说话人属性自动语音识别(ASR)仍然是一个重要挑战,尤其是当以说话人嵌入向量为条件的系统无法泛化到未见说话人时。在本工作中,我们提出了 Diarization-Conditioned Whisper(DiCoW),一种用于目标说话人 ASR 的新方法,该方法利用说话人分割输出作为条件信息。DiCoW 通过在预训练的 Whisper 模型中集成说话人分割标签,直接整合分割标签,从而消除了对说话人嵌入向量的依赖,减少了大量说话人特定训练数据的需求。我们的方法引入了帧级说话人分割依赖变换(FDDT)和查询-键偏置(QKb)技术,以细化模型对目标说话人注意力的聚焦,同时有效处理重叠语音。通过将说话人分割输出作为条件信号,DiCoW 简化了多说话人 ASR 的工作流程,提高了对未见说话人的泛化能力,并在实际多说话人录音中实现更可靠的转录。此外,我们还探讨了将连接时序分类(CTC)头集成到 Whisper 中,并展示了其通过混合解码提高转录效率的能力。值得注意的是,我们的做法不仅限于 Whisper,也在应用到 Branchformer 模型时提供了类似的益处。我们在真实数据集上对 DiCoW 进行了验证,包括来自 CHiME-8 挑战赛的 AMI 和 NOTSOFAR-1 数据集,以及合成基准数据集如 Libri2Mix 和 LibriCSS,使我们能够与先前方法进行直接比较。结果表明,DiCoW 在保持 Whisper 在单说话人数据上的准确性和鲁棒性的同时,提升了模型的目标说话人 ASR 能力。
引用
@article{arxiv.2501.00114,
title = {DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition},
author = {Alexander Polok and Dominik Klement and Martin Kocour and Jiangyu Han and Federico Landini and Bolaji Yusuf and Matthew Wiesner and Sanjeev Khudanpur and Jan Černocký and Lukáš Burget},
journal= {arXiv preprint arXiv:2501.00114},
year = {2025}
}