中文

基于单样本适应的语言引导的联合音视频编辑

计算机视觉与模式识别 2024-11-12 v2

摘要

本文提出了一种新任务,称为语言引导的联合音视频编辑。给定音频和图像对,表示发出的事件,旨在条件于语言指导生成新的音视频内容,对给定的发出事件进行编辑。例如,我们可以更改发出物体的背景环境,同时保持其外观不变,或者可以添加与视觉内容相关的新声音。为解决此任务,我们提出了一种新的基于扩散的框架,用于联合音视频编辑,并引入了两个关键思想。首先,我们提出了一种单样本适应方法,用于针对音视频内容编辑定制生成式扩散模型。只需一个音视频样本,我们即可将音频和视觉扩散模型联合迁移到目标域。经过微调后,我们的模型能够生成此音视频样本的一致内容。其次,我们引入了跨模态语义增强方法。我们注意到,当使用语言作为内容编辑指导时,视觉分支可能会忽略编辑要求。这种现象被称为灾难性忽视,会阻碍音视频在内容编辑期间的对齐。因此,我们通过增强语言与视觉之间的语义一致性来缓解此问题。广泛的实验验证了我们方法在语言基础音视频编辑中的有效性,并突显了其优于几个基线方法的优势。我们建议读者访问我们的项目页面获取更多详情:https://liangsusan-git.github.io/project/avedit/。

关键词

引用

@article{arxiv.2410.07463,
  title  = {Language-Guided Joint Audio-Visual Editing via One-Shot Adaptation},
  author = {Susan Liang and Chao Huang and Yapeng Tian and Anurag Kumar and Chenliang Xu},
  journal= {arXiv preprint arXiv:2410.07463},
  year   = {2024}
}

备注

ACCV 2024