中文

对象级音视频编辑模型 Object-AVEdit

多媒体 2025-10-02 v1 人工智能 计算机视觉与模式识别 声音 音频与语音处理

摘要

视频后期制作和电影制作领域对音视频编辑有极高需求。虽然已有诸多模型探索音视频编辑,但在对象级音视频操作方面存在挑战。具体而言,对象级音视频编辑需要能够在音频和视觉两个模态上进行对象的添加、替换和移除,同时在编辑过程中保持源实例的结构信息。本文提出了对象级音视频编辑模型 Object-AVEdit,基于 inversion-regeneration(反演-再生)范式实现对象级编辑。为实现编辑过程中对象级可控性,我们开发了一个面向音频生成的 word-to-sounding-object 高度对齐模型,弥合了对象可控性在音频与当前视频生成模型之间的差距。同时,为实现更好的结构信息保留和对象级编辑效果,我们提出了一种 inversion-regeneration 整体优化的编辑算法,确保在反演阶段信息保留得好,同时在再生阶段效果更佳。大量实验表明,我们的编辑模型在音视频对象级编辑任务中取得了先进成绩,音视频语义对齐效果同样优秀。此外,我们开发的音频生成模型也取得了领先的性能。更多结果请访问我们的项目页面:https://gewu-lab.github.io/Object_AVEdit-website/。

关键词

引用

@article{arxiv.2510.00050,
  title  = {Object-AVEdit: An Object-level Audio-Visual Editing Model},
  author = {Youquan Fu and Ruiyang Si and Hongfa Wang and Dongzhan Zhou and Jiacheng Sun and Ping Luo and Di Hu and Hongyuan Zhang and Xuelong Li},
  journal= {arXiv preprint arXiv:2510.00050},
  year   = {2025}
}