PRIMEdit: 面向实例感知的多对象视频编辑的概率重分布与基准数据集
计算机视觉与模式识别
2025-03-26 v2
摘要
近期基于AI的视频编辑使用户能够通过简单的文本提示编辑视频,显著简化了编辑过程。然而,最近的零样本视频编辑技术主要关注全局或单对象编辑,这可能导致视频其他部分发生意外变化。当需要对多个对象进行局部编辑时,现有方法面临挑战,如编辑不忠实、编辑泄漏以及缺乏合适的评估数据集和指标。为克服这些限制,我们提出了robability edistribution for nstance-aware ulti-object Video ing ()。PRIMEdit是一个零样本框架,引入了两个关键模块:(i) 实例中心概率重分布(IPR)以确保精确定位和忠实编辑,(ii) 解耦多实例采样(DMS)以防止编辑泄漏。此外,我们提出了新的MIVE数据集,包含多样化的视频场景,并引入了跨实例准确率(CIA)分数来评估多实例视频编辑任务中的编辑泄漏。我们广泛的定性、定量和用户研究评估表明,PRIMEdit在编辑忠实性、准确性和泄漏预防方面显著优于最近的最先进方法,为多实例视频编辑设立了新的基准。
引用
@article{arxiv.2412.12877,
title = {PRIMEdit: Probability Redistribution for Instance-aware Multi-object Video Editing with Benchmark Dataset},
author = {Samuel Teodoro and Agus Gunawan and Soo Ye Kim and Jihyong Oh and Munchurl Kim},
journal= {arXiv preprint arXiv:2412.12877},
year = {2025}
}
备注
The first two authors contributed equally to this work. The last two authors are co-corresponding authors. Please visit our project page at https://kaist-viclab.github.io/primedit-site/