UniFlow-Audio:面向全模态的统一流匹配音频生成
声音
2025-09-30 v1
摘要
音频生成,包括语音、音乐和音效,近年来发展迅速。这些任务可分为两类:时间对齐(TA)任务,其中每个输入单元对应输出音频的特定片段(如语音合成中音素与帧的对齐);以及非时间对齐(NTA)任务,其中此类对齐不可用。由于这两类任务的建模范式通常不同,不同音频生成任务的研究传统上遵循各自的轨迹。然而,音频本身并非天然分为此类,因此统一模型是通用音频生成的自然且必要的目标。先前的统一音频生成工作采用了自回归架构,而统一的非自回归方法仍 largely 未被探索。在这项工作中,我们提出了 UniFlow-Audio,一个基于流匹配的通用音频生成框架。我们提出了一种双融合机制,在每个模型块中将音频潜变量与 TA 特征进行时间对齐,并通过交叉注意力整合 NTA 特征。采用任务平衡的数据采样以保持在 TA 和 NTA 任务上的强劲性能。UniFlow-Audio 支持全模态,包括文本、音频和视频。通过利用多任务学习的优势和流匹配的生成建模能力,UniFlow-Audio 在使用不到 8K 小时公开训练数据和不到 1B 可训练参数的情况下,在 7 个任务上取得了强劲结果。即使仅有约 200M 可训练参数的小型变体也展现出具有竞争力的性能,凸显 UniFlow-Audio 作为音频生成潜在非自回归基础模型的潜力。代码和模型将在 https://wsntxxn.github.io/uniflow_audio 上发布。
引用
@article{arxiv.2509.24391,
title = {UniFlow-Audio: Unified Flow Matching for Audio Generation from Omni-Modalities},
author = {Xuenan Xu and Jiahao Mei and Zihao Zheng and Ye Tao and Zeyu Xie and Yaoyun Zhang and Haohe Liu and Yuning Wu and Ming Yan and Wen Wu and Chao Zhang and Mengyue Wu},
journal= {arXiv preprint arXiv:2509.24391},
year = {2025}
}
备注
Project page: https://wsntxxn.github.io/uniflow_audio