结合预训练 AV-HuBERT 与掩码恢复策略的目标语音提取
声音
2024-03-26 v1 音频与语音处理
摘要
音视频目标语音提取(AV-TSE)是机器人学和许多音视频应用中的一项关键技术。AV-TSE 的挑战之一是如何在该过程中有效利用音视频同步信息。AV-HuBERT 可以作为一个有用的用于唇语阅读的预训练模型,但尚未被 AV-TSE 采用。在本文中,我们希望探索将预训练 AV-HuBERT 集成到我们的 AV-TSE 系统中的方法。我们有充分的理由期待性能的提升。为了从模态间和模态内的相关性中获益,我们还提出了一种用于自监督学习的新型掩码恢复策略。在 VoxCeleb2 数据集上的实验结果表明,我们提出的模型在主观和客观指标上均优于基线,表明预训练的 AV-HuBERT 模型为目标语音提取提供了更多信息的视觉线索。此外,通过对比研究,我们证实了所提出的掩码恢复策略具有显著的有效性。
引用
@article{arxiv.2403.16078,
title = {Target Speech Extraction with Pre-trained AV-HuBERT and Mask-And-Recover Strategy},
author = {Wenxuan Wu and Xueyuan Chen and Xixin Wu and Haizhou Li and Helen Meng},
journal= {arXiv preprint arXiv:2403.16078},
year = {2024}
}
备注
Accepted by IJCNN 2024