多人互动说话数据集
计算机视觉与模式识别
2025-08-06 v1
摘要
现有关于说话视频生成的研究主要聚焦于单人独白或孤立面部动画,限制了其在真实多人互动场景中的适用性。为填补这一空白,我们推出MIT数据集,专为多人说话视频生成而设计。为此,我们开发了一个自动收集和标注多人对话视频的管道。该数据集包含12小时高分辨率视频素材,每个视频包含2至4位演讲者,附带身体姿态和语音互动的细粒度标注。它捕捉了多说话者情境下的自然对话动态,为研究交互式视觉行为提供了丰富资源。为展示MIT的潜力,我们进一步提出CovOG模型作为本新任务的基线。它集成了多人姿态编码器(MPE)来处理不同数量的演讲者,通过聚合individual pose embeddings 实现姿态特征的统一表示;并引入交互式音频驱动器(IAD)基于说话者特定的音频特征调制头部动态。这些组件共同展示了生成真实多人说话视频的可行性与挑战,确立了MIT作为未来研究基准的宝贵资源。代码已公开:https://github.com/showlab/Multi-human-Talking-Video-Dataset。
引用
@article{arxiv.2508.03050,
title = {Multi-human Interactive Talking Dataset},
author = {Zeyu Zhu and Weijia Wu and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2508.03050},
year = {2025}
}
备注
9 pages, 4 figures, 4 tables