InterDyad:基于查询中间视觉指导的交互式双人语音到视频生成
计算机视觉与模式识别
2026-03-25 v1
摘要
尽管语音到视频合成取得了进展,现有方法往往难以捕捉跨个体依赖关系,并在双人场景中提供对反应行为的细粒度控制。为此,我们提出InterDyad框架,通过查询结构化运动指导实现自然的交互动态合成。具体而言,我们首先设计了交互注入器 (Interactivity Injector),基于从参考视频中提取的身份无关运动先验实现视频重作。基于此,我们引入基于MetaQuery的模态对齐机制,以桥接对话音频与这些运动先验之间的差距。通过利用多模态大语言模型 (MLLM),我们的框架能够从音频中提炼出语言意图,以指示精确的时机和恰当的反应。为进一步提高在极端头部姿态下的唇音同步质量,我们提出基于角色的双高斯指导 (Role-aware Dyadic Gaussian Guidance, RoDG),实现更好的唇音同步和空间一致性。最后,我们引入专门的评估套件,包含新设计的度量,以量化双人交互。广泛的实验表明,InterDyad在生成自然且情境恰当的两个人交互方面显著优于现有SOTA方法。请参阅我们的项目页面观看演示视频:https://interdyad.github.io/。
引用
@article{arxiv.2603.23132,
title = {InterDyad: Interactive Dyadic Speech-to-Video Generation by Querying Intermediate Visual Guidance},
author = {Dongwei Pan and Longwei Guo and Jiazhi Guan and Luying Huang and Yiding Li and Haojie Liu and Haocheng Feng and Wei He and Kaisiyuan Wang and Hang Zhou},
journal= {arXiv preprint arXiv:2603.23132},
year = {2026}
}
备注
Project Page: https://interdyad.github.io/