中文

DyaDiT:面向社交友好的双人手势生成的多模态扩散 Transformer

计算机视觉与模式识别 2026-03-31 v2

摘要

生成真实的对话式手势对于实现与数字人格的自然、社交交互至关重要。然而,现有方法通常将单个音频流映射到单个说话者的动作,未考虑社交语境或建模两个人在对话中相互动态。我们提出DyaDiT,一种多模态扩散 Transformer,用于从双人音频信号生成情境恰当的手势动作。DyaDiT 训练于 Seamless Interaction 数据集,接受双人音频及可选的社交语境 token,生成情境适宜的动作。它融合两个说话者的信息以捕捉互动动态,运用动作词典编码运动先验,可选地利用对话伙伴的手势以产生更具响应性的动作。我们在标准动作生成指标上评估了 DyaDiT,并进行定性用户研究,结果表明它不仅在客观指标上超越现有方法,而且被用户强烈偏好,凸显其鲁棒性和社交友好性动作生成能力。代码和模型将在接受后公开。

关键词

引用

@article{arxiv.2602.23165,
  title  = {DyaDiT: A Multi-Modal Diffusion Transformer for Socially Favorable Dyadic Gesture Generation},
  author = {Yichen Peng and Jyun-Ting Song and Siyeol Jung and Ruofan Liu and Haiyang Liu and Xuangeng Chu and Ruicong Liu and Erwin Wu and Hideki Koike and Kris Kitani},
  journal= {arXiv preprint arXiv:2602.23165},
  year   = {2026}
}

备注

13 pages, 9 figures