用于会议转录的说话人日记化与语音识别串联多任务训练
音频与语音处理
2022-07-11 v1 声音
摘要
基于自监督学习的语音数据预训练模型,如 Wav2Vec 2.0 (W2V2),已成为许多语音任务的骨干。本文中,为使用单一模型实现说话人日记化与语音识别,提出一种串联多任务训练 (TMT) 方法来微调 W2V2。对于说话人日记化,需要语音活动检测 (VAD) 与说话人分类 (SC) 任务,而连接主义时序分类 (CTC) 用于 ASR。该多任务框架利用 W2V2 的早层、中层和晚层分别实现 VAD、SC 和 ASR,这与先用 VAD 分割音频、再基于说话人嵌入对片段聚类、最后用 ASR 转写各片段的顺序一致。在增强多方 (AMI) 数据集上的实验结果表明,TMT 中为 VAD、SC 和 ASR 使用从早到晚的不同 W2V2 层不仅节省计算成本,还降低了日记化错误率 (DERs)。与分别微调模型的基线相比,VAD、SC 和 ASR 的联合微调在手动/自动分割下分别实现了 DER 相对降低 16%/17%,且说话人归属词错误率也一致降低。
引用
@article{arxiv.2207.03852,
title = {Tandem Multitask Training of Speaker Diarisation and Speech Recognition for Meeting Transcription},
author = {Xianrui Zheng and Chao Zhang and Philip C. Woodland},
journal= {arXiv preprint arXiv:2207.03852},
year = {2022}
}
备注
To appear in Interspeech 2022