CosyAudio:利用置信度分数和合成标题提高音频生成
音频与语音处理
2025-01-29 v1 声音
摘要
文本到音频(TTA)生成是 AI 生成内容(AIGC)中的一个新兴领域,通过自然语言描述创建音频。尽管关注度日益增加,但开发稳健的 TTA 模型仍然具有挑战,因为缺乏良好标注数据集,且大规模弱标注语料库中存在标签噪声或不准确。为解决这些挑战,我们提出了 CosyAudio 框架,该框架利用置信度分数和合成标题来提高音频生成质量。CosyAudio 由两个核心组件组成:AudioCapTeller 和音频生成器。AudioCapTeller 为音频生成合成标题并提供置信度分数以评估其准确性。音频生成器使用这些合成标题和置信度分数实现质量感知的音频生成。此外,我们引入了自演化训练策略,迭代优化 CosyAudio 在良好标注和弱标注数据集上的性能。最初使用良好标注数据进行训练的 AudioCapTeller 利用其在弱标注数据集上的评估能力进行高质量过滤和强化学习,从而进一步提高其性能。经过训练的 AudioCapTeller 通过生成新的标题和置信度分数来细化语料库,作为音频生成器的训练数据。大量实验表明,CosyAudio 在自动音频标注、生成更忠实的音频以及在各种场景下表现出强大的泛化能力方面均优于现有模型。
引用
@article{arxiv.2501.16761,
title = {CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions},
author = {Xinfa Zhu and Wenjie Tian and Xinsheng Wang and Lei He and Xi Wang and Sheng Zhao and Lei Xie},
journal= {arXiv preprint arXiv:2501.16761},
year = {2025}
}
备注
12 pages, 5 figures, 7 tables