MMAudio-LABEL:基于音频生成的无声视频音频事件标注
声音
2026-05-04 v1 计算机视觉与模式识别
摘要
近期多模态生成技术的进展使人们能够从无声视频中生成高质量音频。实际应用(如声音制作)不仅需要生成的音频,还需要明确 detailing 声音事件的类型和时间。一种直观的方法是对生成音频应用标准声音事件检测,但该后处理管道本质上受限于误差累积。为此本文提出MMAudio-LABEL(LAtent-Based Event Labeling),这是一种基于作为 backbone 的基础音频生成模型构建的、具备事件感知性的音频生成框架,能够联合从无声视频中生成音频和帧对齐的声音事件预测。我们在 Greatest Hits 数据集上评估了该方法,用于 onset 检测和17类材料分类。我们的做法将onset检测准确率从46.7%提高到75.0%,将材料分类准确率从40.6%提高到61.0%,超越基线方法。这些结果表明,联合学习音频生成和事件预测可实现更具解释性和实用性的视频到音频合成。
引用
@article{arxiv.2605.00495,
title = {MMAudio-LABEL: Audio Event Labeling via Audio Generation for Silent Video},
author = {Kazuya Tateishi and Akira Takahashi and Atsuo Hiroe and Hirofumi Takeda and Shusuke Takahashi and Yuki Mitsufuji},
journal= {arXiv preprint arXiv:2605.00495},
year = {2026}
}
备注
Accepted to the CVPR 2026 Sight and Sound Workshop