中文

SpongeBob:同步感知的音视频和谐生成编辑

计算机视觉与模式识别 2026-05-26 v1

摘要

物理世界中的视觉和声学事件本质上是耦合的,但现有的视频编辑方法通常采用解耦的管道,缺乏双向模态互动。这导致两个关键局限性:(i) 音视频不同步,和 (ii) 生成的音频与保留内容之间存在语境冲突。为此,我们提出了 SpongeBob,这是首个具有双向跨模态互动的端到端音视频联合编辑框架。为实现同步化,SpongeBob 提出 Sync-Aware 机制通过双向注意力、时间对齐和空间约束将视觉编辑与声事件对齐。为实现语境一致性,SpongeBob 提出 Context-Aware 模块利用声学和视觉语境注意力以防止语义冲突。此外,我们引入 Sync-Preserving Training and Guidance (SPTG) 以增强对齐而不降低质量。由于缺乏配对数据,我们构建了一个可扩展的数据管道和大规模主题级数据集。我们还提出了 SpongeBob-Bench 以进行系统化评估。实验表明,SpongeBob 显著优于现有基线,将 Sync-C 提升 30%,Ctx-F1 提升 12.5%。我们的项目页面地址为:https://hy-spongebob.github.io/。

关键词

引用

@article{arxiv.2605.25193,
  title  = {SpongeBob: Sync-Aware Harmonious Audio-Visual Generative Editing},
  author = {Sen Liang and Cong Wang and Fengbin Guan and Zhentao Yu and Yiting Lu and Yuanzhi Wang and Yuan Zhou and Xin Li and Zhibo Chen},
  journal= {arXiv preprint arXiv:2605.25193},
  year   = {2026}
}