面向 MISP 2022 挑战赛的 FlySpeech 音视觉说话人日记化系统
声音
2023-07-31 v1 音频与语音处理
摘要
本文描述了提交至 ICASSP 2022 举办的第二届基于多模态信息的语音处理(MISP)挑战赛的 FlySpeech 说话人日记化系统。我们开发了一个端到端音视觉说话人日记化(AVSD)系统,由唇部编码器、说话人编码器和音视觉解码器组成。具体而言,为缓解因分离训练导致的日记化性能退化,我们联合训练说话人编码器与音视觉解码器。此外,我们利用大数据预训练的说话人提取器来初始化说话人编码器。
引用
@article{arxiv.2307.15400,
title = {The FlySpeech Audio-Visual Speaker Diarization System for MISP Challenge 2022},
author = {Li Zhang and Huan Zhao and Yue Li and Bowen Pang and Yannan Wang and Hongji Wang and Wei Rao and Qing Wang and Lei Xie},
journal= {arXiv preprint arXiv:2307.15400},
year = {2023}
}