听到您的点击:交互式对象特定视频到音频生成
计算机视觉与模式识别
2025-07-15 v2 人工智能
多媒体
声音
音频与语音处理
摘要
视频到音频(V2A)生成在电影制作等领域展现出巨大的潜力。尽管取得了显著进展,但依赖全局视频信息的当前 V2A 方法在处理复杂场景和生成针对特定对象的音频方面存在挑战。为此,我们引入 Hear-Your-Click,一个交互式 V2A 框架,使用户能够通过点击帧来为特定对象生成声音。为实现这一目标,我们提出了对象感知对比音视频微调(OCAV),并配备掩码引导视觉编码器(MVE)以获取与音频对齐的对象级视觉特征。此外,我们针对增强模型对分段对象的敏感性,设计了两种数据增强策略:随机视频拼接(RVS)和掩码引导音量调制(MLM)。为衡量音视频对应关系,我们设计了新的评估指标,即 CAV 分数。广泛的实验表明,我们的框架在各种指标上提供了更精确的控制并提升了生成性能。项目页面:https://github.com/SynapGrid/Hear-Your-Click
引用
@article{arxiv.2507.04959,
title = {Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation},
author = {Yingshan Liang and Keyu Fan and Zhicheng Du and Yiran Wang and Qingyang Shi and Xinyu Zhang and Jiasheng Lu and Peiwu Qin},
journal= {arXiv preprint arXiv:2507.04959},
year = {2025}
}