中文

DualTalk: 双说话者 3D 说话头对话交互

计算机视觉与模式识别 2025-05-27 v2 声音 音频与语音处理

摘要

在面对面对话中,个体需要无缝地在说话与倾听角色之间切换。现有 3D 说话头生成模型仅关注说话或倾听,忽略了交互式对话中自然的动态行为,导致生成的交互不够自然且转换生硬。为此,我们提出一个新任务——3D 说话头对话的多轮双说话者交互,需要模型处理和生成连续对话中的说话与倾听行为。为解决此任务,我们引入 DualTalk,一个新型统一框架,将说话者和倾听者的动态行为整合,以模拟真实且连贯的对话交互。该框架不仅在说话时能生成逼真的说话头,生成倾听时也能持续且富有表现力的非语言反馈,有效捕捉角色之间的相互作用。我们还创建了一个新数据集,包含 50 小时的多轮对话,超过 1000 位角色,其中参与者不断在说话与倾听角色之间切换。大量实验表明,我们的方法显著提升了双说话者对话中 3D 说话头的自然性和表达性。我们建议观看补充视频:https://ziqiaopeng.github.io/dualtalk。

关键词

引用

@article{arxiv.2505.18096,
  title  = {DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations},
  author = {Ziqiao Peng and Yanbo Fan and Haoyu Wu and Xuan Wang and Hongyan Liu and Jun He and Zhaoxin Fan},
  journal= {arXiv preprint arXiv:2505.18096},
  year   = {2025}
}

备注

Accepted by CVPR 2025