中文

面向 MISP 2022 挑战赛的 FlySpeech 音视觉说话人日记化系统

声音 2023-07-31 v1 音频与语音处理

摘要

本文描述了提交至 ICASSP 2022 举办的第二届基于多模态信息的语音处理(MISP)挑战赛的 FlySpeech 说话人日记化系统。我们开发了一个端到端音视觉说话人日记化(AVSD)系统,由唇部编码器、说话人编码器和音视觉解码器组成。具体而言,为缓解因分离训练导致的日记化性能退化,我们联合训练说话人编码器与音视觉解码器。此外,我们利用大数据预训练的说话人提取器来初始化说话人编码器。

关键词

引用

@article{arxiv.2307.15400,
  title  = {The FlySpeech Audio-Visual Speaker Diarization System for MISP Challenge 2022},
  author = {Li Zhang and Huan Zhao and Yue Li and Bowen Pang and Yannan Wang and Hongji Wang and Wei Rao and Qing Wang and Lei Xie},
  journal= {arXiv preprint arXiv:2307.15400},
  year   = {2023}
}