薛定谔音视频编辑器:目标级音视频移除
计算机视觉与模式识别
2025-12-16 v1 多媒体
声音
摘要
音频与视觉内容的联合编辑对于精确和可控的内容创作至关重要。这一新任务由于目标编辑前后配对的音视频数据的局限性以及跨模态的异构性而面临挑战。为了解决联合音视频编辑中的数据与建模挑战,我们引入了SAVEBench,一个带有文本和掩码条件的配对音视频数据集,以实现基于目标的源到目标学习。利用SAVEBench,我们训练了薛定谔音视频编辑器(SAVE),一个端到端的流匹配模型,在处理过程中并行编辑音频和视频并保持它们的对齐。SAVE结合了一个薛定谔桥,学习从源到目标音视频混合物的直接传输。我们的评估表明,所提出的SAVE模型能够在保留剩余内容的同时移除音视频内容中的目标对象,与音频编辑器和视频编辑器的成对组合相比,具有更强的时间同步性和音视频语义对应性。
引用
@article{arxiv.2512.12875,
title = {Schrodinger Audio-Visual Editor: Object-Level Audiovisual Removal},
author = {Weihan Xu and Kan Jen Cheng and Koichi Saito and Muhammad Jehanzeb Mirza and Tingle Li and Yisi Liu and Alexander H. Liu and Liming Wang and Masato Ishii and Takashi Shibuya and Yuki Mitsufuji and Gopala Anumanchipalli and Paul Pu Liang},
journal= {arXiv preprint arXiv:2512.12875},
year = {2025}
}