中文

Audiobox TTA-RAG:改进零样本和少样本文本到音频的检索增强生成

音频与语音处理 2025-06-09 v2 声音

摘要

本工作专注于改进零样本和少样本设置下的文本到音频(TTA)生成(即生成未见或不常见的音频事件)。受大型语言模型中检索增强生成(RAG)成功的启发,我们提出了Audiobox TTA-RAG,这是一种基于Audiobox(一种流匹配音频生成模型)的新型检索增强TTA方法。与仅根据文本生成音频的原始Audiobox TTA解决方案不同,我们通过同时增强文本和检索到的音频样本来扩展TTA过程。我们的检索方法不需要外部数据库具有标注音频,提供了更实用的使用场景。我们证明,所提出的模型可以有效利用检索到的音频样本,并显著改进零样本和少样本TTA性能,在多个评估指标上具有较大优势,同时保持在领域内设置中生成语义对齐音频的能力。

关键词

引用

@article{arxiv.2411.05141,
  title  = {Audiobox TTA-RAG: Improving Zero-Shot and Few-Shot Text-To-Audio with Retrieval-Augmented Generation},
  author = {Mu Yang and Bowen Shi and Matthew Le and Wei-Ning Hsu and Andros Tjandra},
  journal= {arXiv preprint arXiv:2411.05141},
  year   = {2025}
}

备注

Interspeech 2025