PPPR:面向文本到音频生成的可移植插件式提示优化器
声音
2024-06-10 v1 音频与语音处理
摘要
文本到音频(TTA)旨在生成对应给定文本描述的音频,在媒体制作中发挥着关键作用。TTA 数据集中的文本描述缺乏丰富的变体和多样性,导致在面对复杂文本时 TTA 模型性能下降。为此,我们提出了一种称为可移植插件式提示优化器(PPPR)的方法,该方法利用大型语言模型中固有于文本描述的丰富知识,有效提升了 TTA 声学模型的鲁棒性,而无需更改声学训练集。此外,我们引入一种模仿人类验证的链式思维,以提高音频描述的准确性,从而提高实际应用中生成内容的准确性。实验表明,我们的方法在创新分数(IS)方面实现了最高值 8.72,超越了 AudioGen、AudioLDM 和 Tango。
引用
@article{arxiv.2406.04683,
title = {PPPR: Portable Plug-in Prompt Refiner for Text to Audio Generation},
author = {Shuchen Shi and Ruibo Fu and Zhengqi Wen and Jianhua Tao and Tao Wang and Chunyu Qiang and Yi Lu and Xin Qi and Xuefei Liu and Yukun Liu and Yongwei Li and Zhiyong Wang and Xiaopeng Wang},
journal= {arXiv preprint arXiv:2406.04683},
year = {2024}
}
备注
accepted by INTERSPEECH2024