驯服数据与变换器用于音频生成
声音
2025-04-17 v4 计算与语言
计算机视觉与模式识别
多媒体
音频与语音处理
摘要
环境声生成器的可扩展性受数据稀缺、标注质量不足以及模型架构可扩展性有限的限制。本文通过推进数据和模型扩展来应对这些挑战。首先,我们提出了一种高效且可扩展的环境音频生成数据收集管道,构建了 AutoReCap-XL——最大的环境音频-文本数据集,包含超过 4700 万个片段。为提供高质量的文本标注,我们提出 AutoCap,一种高质量的自动音频标aption 模型。通过采用 Q-Former 模块并利用音频元数据,AutoCap 大幅提升了标注质量,达到 CIDEr 分数 ,比以前的标注模型提高了 。最后,我们提出 GenAu,一种基于变换器的可扩展音频生成架构,规模扩展至 12.5 亿参数。我们展示了其在合成标注数据以及模型规模扩展方面的优势。与在相似规模和数据规模下训练的基线音频生成器相比,GenAu 在 FAD 分数上提高了 ,在 IS 上提高了 ,在 CLAP 分数上提高了 。我们的代码、模型检查点和数据集已公开可用。
引用
@article{arxiv.2406.19388,
title = {Taming Data and Transformers for Audio Generation},
author = {Moayed Haji-Ali and Willi Menapace and Aliaksandr Siarohin and Guha Balakrishnan and Vicente Ordonez},
journal= {arXiv preprint arXiv:2406.19388},
year = {2025}
}
备注
Project Webpage: https://snap-research.github.io/GenAU/