联合训练与否:预训练语音模型在视听说话人日志中的探索
音频与语音处理
2023-12-08 v1 声音
摘要
标注视听数据集的稀缺限制了训练更优视听说话人日志系统。为了提升视听说话人日志的性能,我们利用预训练的监督和自监督语音模型。具体地,我们在端到端视听说话人日志(AVSD)系统中采用监督(ResNet和ECAPA-TDNN)和自监督预训练模型(WavLM和HuBERT)作为说话人和音频嵌入提取器。然后我们探索不同框架(包括Transformer、Conformer和交叉注意力机制)在视听解码器中的有效性。为了缓解分开训练导致的性能下降,我们在AVSD系统中联合训练音频编码器、说话人编码器和视听解码器。在MISP数据集上的实验表明,所提方法取得了优越性能,并在MISP Challenge 2022中获得第三名。
引用
@article{arxiv.2312.04131,
title = {Joint Training or Not: An Exploration of Pre-trained Speech Models in Audio-Visual Speaker Diarization},
author = {Huan Zhao and Li Zhang and Yue Li and Yannan Wang and Hongji Wang and Wei Rao and Qing Wang and Lei Xie},
journal= {arXiv preprint arXiv:2312.04131},
year = {2023}
}