IDOL:面向人类中心任务的统一双模态潜在扩散视频深度联合生成
计算机视觉与模式识别
2024-07-16 v1
摘要
人类中心视频生成领域取得了显著进展,但联合视频深度生成问题仍未得到充分探索。大多数单目深度估计方法对合成图像或视频的泛化能力有限,多视角方法则难以控制人体外观与动作。本文提出IDOL(unIfied Dual-mOdal Latent diffusion),用于高质量的人类中心联合视频深度生成。IDOL包含两个新颖设计:首先,为实现双模态生成并最大化视频与深度生成之间的信息交互,提出统一双模态U-Net,一种用于联合视频和深度去噪的参数共享框架,通过模态标签引导去噪目标,交叉注意力机制实现信息的相互流动。其次,为确保视频深度的精确空间对齐,提出运动一致性损失,强制视频和深度特征运动场之间的一致性,从而实现输出的和谐。此外,应用交叉注意力图一致性损失,对齐视频去噪与深度去噪的交叉注意力图,进一步促进空间对齐。在TikTok和NTU120数据集上的大量实验表明,我们的方法在视频FVD和深度精度方面显著优于现有方法。
引用
@article{arxiv.2407.10937,
title = {IDOL: Unified Dual-Modal Latent Diffusion for Human-Centric Joint Video-Depth Generation},
author = {Yuanhao Zhai and Kevin Lin and Linjie Li and Chung-Ching Lin and Jianfeng Wang and Zhengyuan Yang and David Doermann and Junsong Yuan and Zicheng Liu and Lijuan Wang},
journal= {arXiv preprint arXiv:2407.10937},
year = {2024}
}
备注
ECCV 2024; project page: https://yhzhai.github.io/idol/