面对面:用于多人交互建模的视频数据集
计算机视觉与模式识别
2026-04-01 v2 机器学习
摘要
modeling 人类对话的反应节奏仍然具有挑战性,因为大多数音视频数据集描绘的是孤立的说话者进行短篇独白。我们引入 **Face-to-Face with Jimmy Fallon (F2F-JF)**,一个包含 70 小时、14k 个片段的两人脱口秀交互数据集,保留了来宾说话时刻与主持人回应之间的时序依赖关系。半自动管道结合多人跟踪、语音分割和轻量级人类验证,提取出带有紧密裁切和就绪状态下游建模的时序对齐的主持人/来宾轨迹。我们展示了该数据集,演示了一个基于语音驱动的数字化化身任务,其中在 时间段的主持人视频是根据其音频以及来宾在 时间段的前导视频生成。以跨人视觉上下文为条件的多任务扩散模型,相对于仅使用音频的基线,在保持 lip-sync 质量的同时,实现了情感-FID 和 FVD 的小幅但持续的提升。该数据集、预处理配方以及基线模型共同为研究 dyadic 时序行为提供了端到端的蓝图,我们在全文中进一步扩展了该工作。数据集和代码已 disponible at https://face2face2026.github.io。
引用
@article{arxiv.2603.14794,
title = {Face-to-Face: A Video Dataset for Multi-Person Interaction Modeling},
author = {Ernie Chu and Vishal M. Patel},
journal= {arXiv preprint arXiv:2603.14794},
year = {2026}
}
备注
Project Page: https://face2face2026.github.io