中文

SonicRAG:基于检索增强生成的高保真音效合成

声音 2025-05-14 v2 音频与语音处理

摘要

大型语言模型(LLM)在自然语言处理(NLP)和多模态学习中展现了卓越的能力,并成功应用于文本生成和语音合成,从而能够更深入地理解和生成多模态内容。在音效(SFX)生成领域,LLM 已被用于协调多个模型进行音频合成。然而,由于标注数据集的稀缺以及时间建模的复杂性,当前的音效生成技术在实现高保真音频方面仍有不足。为解决这些局限性,本文引入了一个新颖的框架,该框架将 LLM 与现有音效数据库集成,允许根据用户需求进行音频的检索、重组和合成。通过利用这种方法,我们增强了生成音效的多样性和质量,同时消除了额外的录音成本,为声音设计和应用提供了一种灵活高效的解决方案。

关键词

引用

@article{arxiv.2505.03244,
  title  = {SonicRAG : High Fidelity Sound Effects Synthesis Based on Retrival Augmented Generation},
  author = {Yu-Ren Guo and Wen-Kai Tai},
  journal= {arXiv preprint arXiv:2505.03244},
  year   = {2025}
}

备注

8 pages, 5 figures