中文

PIAVE:一种姿态不变的音视觉说话人提取网络

声音 2023-09-14 v1 多媒体 音频与语音处理

摘要

在日常口语交流中,我们看着说话者转头的面孔来听其声音是常见现象。人类通过看说话者来更好地听清,机器亦然。然而,以往关于音视觉说话人提取的研究未能有效处理变化的说话人脸部。本文研究如何充分利用变化的说话人脸部。我们提出了一种姿态不变的音视觉说话人提取网络(PIAVE),其引入额外的姿态不变视图以改进音视觉说话人提取。具体而言,我们从每个原始姿态方向生成姿态不变视图,使模型无论说话者头部姿态如何都能接收到一致的正脸视图,从而为其形成多视图视觉输入。在多视图 MEAD 和真实场景 LRS3 数据集上的实验表明,PIAVE 优于当前最优方法,并对姿态变化更具鲁棒性。

关键词

引用

@article{arxiv.2309.06723,
  title  = {PIAVE: A Pose-Invariant Audio-Visual Speaker Extraction Network},
  author = {Qinghua Liu and Meng Ge and Zhizheng Wu and Haizhou Li},
  journal= {arXiv preprint arXiv:2309.06723},
  year   = {2023}
}

备注

Interspeech 2023