中文

YingSound:基于多模态链式思维控制的视频导向音效生成

声音 2024-12-13 v1 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

为产品级视频生成音效的任务在标注数据有限的情况下,需要在少样本场景中产出高质量声音。为解决现实场景标注数据稀缺的挑战,我们引入 YingSound,一种为视频导向声音生成设计的基础模型,支持在少样本设置下实现高质量音频生成。具体而言,YingSound 包含两个主要模块。第一个模块使用条件流匹配变换器实现音频与视觉模态间的有效语义对齐,以实现跨模态的声音生成。该模块旨在构建可学习的音视频聚合器 (AVA),在多个阶段将高分辨率视觉特征与相应音频特征集成。第二个模块基于提出的多模态视觉-音频链式思维 (CoT) 方法,用于在少样本设置下生成更细致的声效。最后, presented 一个行业标准的视频到音频 (V2A) 数据集,涵盖各种现实场景。我们通过自动化评估和人类研究表明,YingSound 能有效生成多样化条件输入下的高质量同步声音。项目页面: \url{https://giantailab.github.io/yingsound/}

关键词

引用

@article{arxiv.2412.09168,
  title  = {YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls},
  author = {Zihao Chen and Haomin Zhang and Xinhan Di and Haoyu Wang and Sizhe Shan and Junjie Zheng and Yunming Liang and Yihan Fan and Xinfa Zhu and Wenjie Tian and Yihua Wang and Chaofan Ding and Lei Xie},
  journal= {arXiv preprint arXiv:2412.09168},
  year   = {2024}
}

备注

16 pages, 4 figures