中文

MoCA-Video:面向一致性视频编辑的运动感知概念对齐

计算机视觉与模式识别 2025-12-15 v2 人工智能

摘要

我们提出了 MoCA-Video,一个用于视频中语义混合的免训练框架。在冻结的视频扩散模型的潜在空间中运作,MoCA-Video 利用类无关分割与对角去噪调度器来定位并跟踪跨帧的目标对象。为确保语义偏移下的时间稳定性,我们引入了基于动量的校正来逼近超越训练数据分布的新型混合分布,并辅以一个轻量级 gamma 残差模块来平滑视觉伪影。我们使用 SSIM、LPIPS 以及一个提出的指标 \metricnameabbr 评估模型性能,该指标量化了参考与输出之间的语义对齐程度。广泛评估表明,我们的模型始终优于免训练和已训练的基线方法,在无需重训练的情况下实现了卓越的语义混合与时间连贯性。结果表明,对扩散噪声轨迹的结构化操控使得在语义偏移下进行可控且高质量的视频编辑成为可能。

关键词

引用

@article{arxiv.2506.01004,
  title  = {MoCA-Video: Motion-Aware Concept Alignment for Consistent Video Editing},
  author = {Tong Zhang and Juan C Leon Alcazar and Victor Escorcia and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2506.01004},
  year   = {2025}
}