中文

跨模态感知器:能否从声音中推断人脸几何结构?

计算机视觉与模式识别 2022-03-21 v1 机器学习 音频与语音处理

摘要

本研究深入探讨人类感知中的一个根本问题:能否从一个人的声音中推断出其人脸几何结构?以往研究该问题的工作仅采用图像合成方面的进展,将声音转换为人脸图像以展示相关性,但在图像域上工作不可避免地需要预测声音无法提示的属性,包括面部纹理、发型和背景。我们转而研究重建三维人脸的能力,以仅聚焦于几何结构,这在生理学上更具依据。我们提出了分析框架 Cross-Modal Perceptionist,涵盖监督与无监督学习两种设定。首先,我们构建了数据集 Voxceleb-3D,其扩展了 Voxceleb 并包含配对的语音与人脸网格,使监督学习成为可能。其次,我们利用知识蒸馏机制,研究在三维人脸扫描数据有限可用、无配对语音与三维人脸数据的情况下,是否仍能从声音中推断人脸几何结构。我们将核心问题拆解为四个部分,并借助可视化与数值分析对核心问题作出回应。我们的发现与生理学及神经科学中关于声音与面部结构相关性的结论相呼应。该工作为未来以人为中心的跨模态学习提供了可解释的基础。参见项目页面:https://choyingw.github.io/works/Voice2Mesh/index.html

关键词

引用

@article{arxiv.2203.09824,
  title  = {Cross-Modal Perceptionist: Can Face Geometry be Gleaned from Voices?},
  author = {Cho-Ying Wu and Chin-Cheng Hsu and Ulrich Neumann},
  journal= {arXiv preprint arXiv:2203.09824},
  year   = {2022}
}

备注

Accepted to CVPR 2022. Project page: https://choyingw.github.io/works/Voice2Mesh/index.html. This version supersedes arXiv:2104.10299