AVI-Edit:基于粒度感知掩码细化的音频同步视频实例编辑
计算机视觉与模式识别
2026-05-05 v4
摘要
近期视频生成技术的进展凸显,真实的音频-视觉同步对于创造引人入胜的内容至关重要。然而,现有视频编辑方法忽视了音频-视觉同步,且缺乏实现精确实例级编辑所需的细粒度空间与时间可控性。本文提出 AVI-Edit,一个用于音频同步视频实例编辑的框架。我们提出粒度感知掩码细化器,迭代细化用户提供的粗糙掩码为精确的实例级区域。我们进一步设计自反馈音频代理,筛选高质量的音频指导,实现细粒度的时间控制。为支持此任务,我们额外构建了一个包含实例级对应关系和详尽注释的大规模数据集。广泛的实验表明,AVI-Edit 在视觉质量、条件跟随和音频-视觉同步方面超越了最先进的方法。项目页面:https://hjzheng.net/projects/AVI-Edit/。
引用
@article{arxiv.2512.10571,
title = {AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner},
author = {Haojie Zheng and Shuchen Weng and Jingqi Liu and Siqi Yang and Boxin Shi and Xinlong Wang},
journal= {arXiv preprint arXiv:2512.10571},
year = {2026}
}