中文

文本提示不够:声音事件增强提示适配器用于目标风格音频生成

音频与语音处理 2024-09-17 v1 人工智能 声音

摘要

当前主流音频生成方法主要依赖简单文本提示,往往难以捕捉多风格音频生成所必需的细微细节。为解决这一局限性,提出了声音事件增强提示适配器(Sound Event Enhanced Prompt Adapter)。不同于传统的静态全局风格迁移,该方法通过文本与参考音频之间的交叉注意力提取风格嵌入,以实现自适应风格控制。随后采用自适应层归一化来增强模型表达多种风格的能力。此外,引入了用于提出的目标风格音频生成任务的声音事件参考风格迁移数据集(Sound Event Reference Style Transfer Dataset, SERST),使模型能够使用文本和音频参考双提示进行音频生成。实验结果表明,该模型具有良好的鲁棒性,实现了领先的 F\'echet Distance 为 26.94 和 KL 散度为 1.82,超越了 Tango、AudioLDM 和 AudioGen。此外,生成的音频与其对应的音频参考高度相似。演示、代码和数据集已公开可用。

关键词

引用

@article{arxiv.2409.09381,
  title  = {Text Prompt is Not Enough: Sound Event Enhanced Prompt Adapter for Target Style Audio Generation},
  author = {Chenxu Xiong and Ruibo Fu and Shuchen Shi and Zhengqi Wen and Jianhua Tao and Tao Wang and Chenxing Li and Chunyu Qiang and Yuankun Xie and Xin Qi and Guanjun Li and Zizheng Yang},
  journal= {arXiv preprint arXiv:2409.09381},
  year   = {2024}
}

备注

5 pages, 2 figures, submitted to ICASSP 2025