TACO:用于真实场景视频非模态补全的控制扩散模型
计算机视觉与模式识别
2025-08-05 v2
摘要
人类能够依靠对物理世界的广泛先验知识,从有限的视觉线索中推断出物体的完整形状和外观。然而,在确保跨视频帧一致性的同时完成部分可观测物体,对现有模型而言仍然具有挑战性,尤其是对于非结构化的真实场景视频。本文 tackling 视频非模态补全(VAC)任务,旨在根据指定感兴趣物体的视觉提示,在整个视频中一致地生成完整物体。利用预训练视频扩散模型学到的丰富、一致流形,我们提出了一种条件扩散模型 TACO,将这些流形重新用于 VAC。为使其能够有效且鲁棒地泛化到具有挑战性的真实场景,我们通过系统地对未遮挡视频施加遮挡来策划一个具有多个难度级别的大规模合成数据集。基于此,我们设计了一种渐进式微调范式,从更简单的恢复任务开始,逐步推进到更复杂的任务。我们展示了 TACO 在来自互联网的广泛真实场景视频以及自动驾驶、机器人操作和场景理解中常用的多样化未见数据集上的多功能性。此外,我们证明 TACO 可有效应用于物体重建和姿态估计等多种下游任务,突显其在促进物理世界理解与推理方面的潜力。项目页面:https://jason-aplp.github.io/TACO。
引用
@article{arxiv.2503.12049,
title = {TACO: Taming Diffusion for in-the-wild Video Amodal Completion},
author = {Ruijie Lu and Yixin Chen and Yu Liu and Jiaxiang Tang and Junfeng Ni and Diwen Wan and Gang Zeng and Siyuan Huang},
journal= {arXiv preprint arXiv:2503.12049},
year = {2025}
}
备注
Accepted by ICCV 2025.Project page: https://jason-aplp.github.io/TACO