中文

驯服数据与变换器用于音频生成

声音 2025-04-17 v4 计算与语言 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

环境声生成器的可扩展性受数据稀缺、标注质量不足以及模型架构可扩展性有限的限制。本文通过推进数据和模型扩展来应对这些挑战。首先,我们提出了一种高效且可扩展的环境音频生成数据收集管道,构建了 AutoReCap-XL——最大的环境音频-文本数据集,包含超过 4700 万个片段。为提供高质量的文本标注,我们提出 AutoCap,一种高质量的自动音频标aption 模型。通过采用 Q-Former 模块并利用音频元数据,AutoCap 大幅提升了标注质量,达到 CIDEr 分数 83.283.2,比以前的标注模型提高了 3.2%3.2\%。最后,我们提出 GenAu,一种基于变换器的可扩展音频生成架构,规模扩展至 12.5 亿参数。我们展示了其在合成标注数据以及模型规模扩展方面的优势。与在相似规模和数据规模下训练的基线音频生成器相比,GenAu 在 FAD 分数上提高了 4.7%4.7\%,在 IS 上提高了 11.1%11.1\%,在 CLAP 分数上提高了 13.5%13.5\%。我们的代码、模型检查点和数据集已公开可用。

关键词

引用

@article{arxiv.2406.19388,
  title  = {Taming Data and Transformers for Audio Generation},
  author = {Moayed Haji-Ali and Willi Menapace and Aliaksandr Siarohin and Guha Balakrishnan and Vicente Ordonez},
  journal= {arXiv preprint arXiv:2406.19388},
  year   = {2025}
}

备注

Project Webpage: https://snap-research.github.io/GenAU/