中文

IteraTTA: 一个在文本到音频模型中探索文本提示与音频先验的生成音乐交互界面

音频与语音处理 2023-07-26 v1 人工智能 人机交互 声音

摘要

近期的文本到音频生成技术有潜力让 novice 用户自由生成音乐音频。即使他们不具备和弦进行和乐器等音乐知识, 用户也可以尝试各种文本提示来生成音频。然而, 与图像领域相比, 清晰理解可能音乐音频的空间是困难的, 因为用户无法同时聆听所生成音频的变体。因此我们帮助用户探索不仅文本提示, 还有约束文本到音频音乐生成过程的音频先验。这种双向探索使用户能够通过迭代比较, 辨别不同文本提示和音频先验对生成结果的影响。我们开发的界面 IteraTTA 专门设计用于帮助用户优化文本提示并从生成的音频中选择偏好的音频先验。借此, 用户可以在理解和探索可能结果空间的同时, 逐步达成其松散指定的目标。我们的实现与讨论突出了文本到音频模型特别需要的设计考量, 以及交互技术如何有助于提升其有效性。

关键词

引用

@article{arxiv.2307.13005,
  title  = {IteraTTA: An interface for exploring both text prompts and audio priors in generating music with text-to-audio models},
  author = {Hiromu Yakura and Masataka Goto},
  journal= {arXiv preprint arXiv:2307.13005},
  year   = {2023}
}

备注

Accepted to the 24th International Society for Music Information Retrieval Conference (ISMIR 2023)