中文

利用多模态自监督嵌入的视听语音增强与分离

音频与语音处理 2023-06-02 v3 声音

摘要

AV-HuBERT 是一种多模态自监督学习模型,已被证明对自动语音识别和唇读等分类问题有效。这表明可利用多模态自监督嵌入获得有用的视听语音表征。然而,此类表征能否推广至解决现实世界多模态视听回归任务(如视听语音增强(AVSE)与视听语音分离(AVSS))尚不清楚。本研究中,我们采用预训练的 AV-HuBERT 模型后接一个 SE 模块用于 AVSE 与 AVSS。对比实验结果表明,我们所提模型优于最先进的 AVSE 以及传统纯音频 SE 模型。总之,我们的结果证实了所提模型在采用恰当微调策略下对 AVSS 任务的有效性,表明从 AV-HuBERT 获得的自监督多模态嵌入可推广至视听回归任务。

关键词

引用

@article{arxiv.2210.17456,
  title  = {Audio-Visual Speech Enhancement and Separation by Utilizing Multi-Modal Self-Supervised Embeddings},
  author = {I-Chun Chern and Kuo-Hsuan Hung and Yi-Ting Chen and Tassadaq Hussain and Mandar Gogate and Amir Hussain and Yu Tsao and Jen-Cheng Hou},
  journal= {arXiv preprint arXiv:2210.17456},
  year   = {2023}
}

备注

ICASSP AMHAT 2023