零样态音视频编辑:基于跨模态 Delta 去噪
计算机视觉与模式识别
2025-03-27 v1 机器学习
多媒体
声音
音频与语音处理
摘要
本文提出了一种零样态音视频编辑技术,旨在无需额外模型训练即可将原始音视频内容转化为与指定文本提示对齐的形式。为评估该任务,本文构建了名为 AvED-Bench 的基准数据集,专为零样态音视频编辑设计。AvED-Bench 包含 110 个 10 秒时长的视频,涵盖 VGGSound 数据集中的 11 个类别,提供多样化的提示和场景,要求听觉与视觉元素实现精确对齐,从而实现对齐性评估。我们识别了现有零样态音频和视频编辑方法的局限性,尤其在跨模态同步性和一致性方面,常导致结果不一致。为此,我们提出了 AvED—a 个零样态跨模态 Delta 去噪框架,利用音视频相互作用实现同步且连贯的编辑。AvED 在 AvED-Bench 和最新数据集 OAVE 上均表现出色,验证了其泛化能力。结果可在 https://genjib.github.io/project_page/AVED/index.html 查看。
引用
@article{arxiv.2503.20782,
title = {Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising},
author = {Yan-Bo Lin and Kevin Lin and Zhengyuan Yang and Linjie Li and Jianfeng Wang and Chung-Ching Lin and Xiaofei Wang and Gedas Bertasius and Lijuan Wang},
journal= {arXiv preprint arXiv:2503.20782},
year = {2025}
}
备注
Project page: https://genjib.github.io/project_page/AVED/index.html