论条件音频生成中的开放提示挑战
声音
2023-11-03 v1 计算与语言
音频与语音处理
摘要
文本到音频生成(TTA)从文本描述生成音频,并从音频样本与人工标注文本的配对中学习。然而,音频生成商业化具有挑战性,因为与用于训练 TTA 模型的文本描述相比,用户输入提示往往是不完备的。在本工作中,我们将 TTA 模型视为“黑箱”,并通过两个关键见解来解决用户提示挑战:(1)用户提示通常是不完备的,导致用户提示与训练提示之间存在较大的对齐差距。(2)存在一类音频描述分布,TTA 模型更擅长据此生成更高质量的音频,我们称之为“audionese”。为此,我们利用指令微调模型重写提示,并提议通过间隔排序学习将文本-音频对齐作为反馈信号以改善音频。在客观和主观人类评估中,我们均观察到文本-音频对齐和音乐音频质量的显著提升。
引用
@article{arxiv.2311.00897,
title = {On The Open Prompt Challenge In Conditional Audio Generation},
author = {Ernie Chang and Sidd Srinivasan and Mahi Luthra and Pin-Jie Lin and Varun Nagaraja and Forrest Iandola and Zechun Liu and Zhaoheng Ni and Changsheng Zhao and Yangyang Shi and Vikas Chandra},
journal= {arXiv preprint arXiv:2311.00897},
year = {2023}
}
备注
5 pages, 3 figures, 4 tables