面向条件音频生成的上下文提示编辑
声音
2023-11-03 v1 计算与语言
音频与语音处理
摘要
分布偏移是机器学习模型部署中的核心挑战,因为它们可能难以应对真实世界数据。这在文本到音频生成中尤为明显,其中编码的表征容易被未见过的提示破坏,从而导致生成音频质量下降——有限的文本-音频对对于真实场景下的条件音频生成仍显不足,因为用户提示是不完备的。特别地,我们观察到与使用训练集提示相比,使用用户提示生成的音频样本存在一致的音频质量退化。为此,我们提出了一种基于检索的上下文提示编辑框架,该框架利用训练标题作为示范性样例来重新审视用户提示。我们表明,该框架在收集的用户提示集合上提升了音频质量,这些提示参考训练标题作为样例进行了编辑。
引用
@article{arxiv.2311.00895,
title = {In-Context Prompt Editing For Conditional Audio Generation},
author = {Ernie Chang and Pin-Jie Lin and Yang Li and Sidd Srinivasan and Gael Le Lan and David Kant and Yangyang Shi and Forrest Iandola and Vikas Chandra},
journal= {arXiv preprint arXiv:2311.00895},
year = {2023}
}
备注
5 pages, 3 figures, 2 tables