中文

学习倾听:建模非确定性的双人面部运动

计算机视觉与模式识别 2022-04-19 v1

摘要

我们提出一个建模双人对话中交互交流的框架:给定说话者的多模态输入,我们自回归地输出对应听者运动的多种可能性。我们使用运动-音频交叉注意力 Transformer 将说话者的运动与语音音频结合。此外,我们通过用新颖的运动编码 VQ-VAE 学习真实听者运动的离散潜表示,实现非确定性预测。我们的方法有机地捕获了非语言双人交互的多模态与非确定性本质。而且,它生成与说话者同步的真实 3D 听者面部运动(见视频)。我们通过丰富的实验套件在定性和定量上证明我们的方法优于基线。为推进此研究方向,我们引入一个新颖且大规模的野外双人对话数据集。代码、数据和视频见 https://evonneng.github.io/learning2listen/。

关键词

引用

@article{arxiv.2204.08451,
  title  = {Learning to Listen: Modeling Non-Deterministic Dyadic Facial Motion},
  author = {Evonne Ng and Hanbyul Joo and Liwen Hu and Hao Li and Trevor Darrell and Angjoo Kanazawa and Shiry Ginosar},
  journal= {arXiv preprint arXiv:2204.08451},
  year   = {2022}
}