中文

InstructAV2AV:指令引导的音视频联合编辑

计算机视觉与模式识别 2026-05-19 v1

摘要

近期基于扩散的方法在视频内容操控方面取得了显著进展。然而,这些方法通常忽略伴随的音频,导致音频与编辑结果脱节。在本文中,我们提出 InstructAV2AV,首个指令引导的音视频联合编辑端到端框架。我们首先开发了一个可扩展的数据合成流程,并构建了 InsAVE-80K,这是首个具有高质量源到目标对的大规模音视频编辑数据集。基于这一数据基础,我们适配了音视频生成主干网络以利用其稳健的先验。我们将音视频输入与带噪潜码拼接以锚定源上下文,提出源指令门控注意力以改善指令遵循和内容保留,并引入两阶段训练策略以有效迁移这些预训练先验。大量实验表明,InstructAV2AV 在两个评估集上跨越三个方面的 11 项指标中均优于 state-of-the-art 方法,凸显了其在可控内容创作方面的潜力。项目页面:https://hjzheng.net/projects/InstructAV2AV/。

关键词

引用

@article{arxiv.2605.18467,
  title  = {InstructAV2AV: Instruction-Guided Audio-Video Joint Editing},
  author = {Haojie Zheng and Yixin Yang and Siqi Yang and Shuchen Weng and Boxin Shi},
  journal= {arXiv preprint arXiv:2605.18467},
  year   = {2026}
}