DIVE:驾驭DINO用于主题驱动视频编辑
介观与纳米尺度物理
2024-12-05 v1 量子气体
强关联电子
摘要
在扩散模型在图像生成和编辑方面取得成功后,视频编辑最近获得了广泛关注。然而,保持时间一致性和运动对齐仍然具有挑战性。为此,本文提出DINO引导的视频编辑(DIVE),一个旨在以文本提示或带有特定身份的参考图像为条件,促进源视频中受主题驱动的编辑的框架。DIVE的核心在于利用来自预训练DINOv2模型提取的强大语义特征作为隐式对应关系来指导编辑过程。具体而言,为确保时间运动一致性,DIVE利用DINO特征与源视频的运动轨迹进行对齐。对于精确的主体编辑,DIVE将参考图像的DINO特征整合到预训练的文本到图像模型中,以学习低秩适应(LoRAs),有效注册目标主体的身份。广泛的在多样化真实视频上的实验表明,我们的框架能够实现高质量的编辑结果,保持稳健的运动一致性,凸显了DINO在视频编辑中的潜在价值。项目页面:https://dino-video-editing.github.io
引用
@article{arxiv.2412.03346,
title = {A Lower-Dimensional Remnant of Flux Attachment},
author = {Gerard Valentí-Rojas and Patrik Öhberg},
journal= {arXiv preprint arXiv:2412.03346},
year = {2024}
}
备注
21 pages, 3 figures. Comments and feedback are welcome