PIAVE:一种姿态不变的音视觉说话人提取网络
声音
2023-09-14 v1 多媒体
音频与语音处理
摘要
在日常口语交流中,我们看着说话者转头的面孔来听其声音是常见现象。人类通过看说话者来更好地听清,机器亦然。然而,以往关于音视觉说话人提取的研究未能有效处理变化的说话人脸部。本文研究如何充分利用变化的说话人脸部。我们提出了一种姿态不变的音视觉说话人提取网络(PIAVE),其引入额外的姿态不变视图以改进音视觉说话人提取。具体而言,我们从每个原始姿态方向生成姿态不变视图,使模型无论说话者头部姿态如何都能接收到一致的正脸视图,从而为其形成多视图视觉输入。在多视图 MEAD 和真实场景 LRS3 数据集上的实验表明,PIAVE 优于当前最优方法,并对姿态变化更具鲁棒性。
引用
@article{arxiv.2309.06723,
title = {PIAVE: A Pose-Invariant Audio-Visual Speaker Extraction Network},
author = {Qinghua Liu and Meng Ge and Zhizheng Wu and Haizhou Li},
journal= {arXiv preprint arXiv:2309.06723},
year = {2023}
}
备注
Interspeech 2023