中文

用于社交行为生成的双人交互建模

计算机视觉与模式识别 2024-07-19 v3

摘要

人与人之间的交流宛如一场优美的舞蹈,听者与说者并发交互以维持对话的动态性。因此,一个用于生成听者非语言行为的有效模型需要理解双人语境与交互。在本文中,我们提出了一个有效的框架,用于在双人交互中生成 3D 面部动作。现有工作将听者视为对说者声音和面部动作产生反射行为的反应代理。我们框架的核心是双人交互建模(DIM),这是一种预训练方法,通过掩码与对比学习联合建模说者和听者的动作,以学习捕捉双人语境的表示。为实现非确定性行为的生成,我们通过 VQ-VAE 将听者和说者的动作编码为离散潜在表示。预训练模型进一步微调用于动作生成。大量实验证明了我们的框架在生成听者动作方面的优越性,根据捕捉生成动作多样性与真实性的定量指标,确立了新的 SOTA。定性结果证明了所提方法在生成多样且真实的表情、眨眼和头部动作方面的卓越能力。代码可在 https://github.com/Boese0601/Dyadic-Interaction-Modeling 获取。

关键词

引用

@article{arxiv.2403.09069,
  title  = {Dyadic Interaction Modeling for Social Behavior Generation},
  author = {Minh Tran and Di Chang and Maksim Siniukov and Mohammad Soleymani},
  journal= {arXiv preprint arXiv:2403.09069},
  year   = {2024}
}

备注

The first two authors contribute equally. The paper is accepted by ECCV 2024. Project Page: https://boese0601.github.io/dim/ Code: https://github.com/Boese0601/Dyadic-Interaction-Modeling