中文

IDOL:面向人类中心任务的统一双模态潜在扩散视频深度联合生成

计算机视觉与模式识别 2024-07-16 v1

摘要

人类中心视频生成领域取得了显著进展,但联合视频深度生成问题仍未得到充分探索。大多数单目深度估计方法对合成图像或视频的泛化能力有限,多视角方法则难以控制人体外观与动作。本文提出IDOL(unIfied Dual-mOdal Latent diffusion),用于高质量的人类中心联合视频深度生成。IDOL包含两个新颖设计:首先,为实现双模态生成并最大化视频与深度生成之间的信息交互,提出统一双模态U-Net,一种用于联合视频和深度去噪的参数共享框架,通过模态标签引导去噪目标,交叉注意力机制实现信息的相互流动。其次,为确保视频深度的精确空间对齐,提出运动一致性损失,强制视频和深度特征运动场之间的一致性,从而实现输出的和谐。此外,应用交叉注意力图一致性损失,对齐视频去噪与深度去噪的交叉注意力图,进一步促进空间对齐。在TikTok和NTU120数据集上的大量实验表明,我们的方法在视频FVD和深度精度方面显著优于现有方法。

关键词

引用

@article{arxiv.2407.10937,
  title  = {IDOL: Unified Dual-Modal Latent Diffusion for Human-Centric Joint Video-Depth Generation},
  author = {Yuanhao Zhai and Kevin Lin and Linjie Li and Chung-Ching Lin and Jianfeng Wang and Zhengyuan Yang and David Doermann and Junsong Yuan and Zicheng Liu and Lijuan Wang},
  journal= {arXiv preprint arXiv:2407.10937},
  year   = {2024}
}

备注

ECCV 2024; project page: https://yhzhai.github.io/idol/