中文

PAGURI:文本到音乐模型的创意交互用户体验研究

声音 2025-10-06 v4 音频与语音处理

摘要

近年来,文本到音乐模型是自动音乐生成领域的最大突破。尽管它们无疑是技术进步的绝佳示例,但尚不清楚它们如何能被现实地集成到音乐家和音乐从业者的艺术实践中。本文旨在通过 Prompt Audio Generation User Research Investigation (PAGURI) 来回答这一问题,这是一项用户体验研究,我们利用最新的文本到音乐技术来研究音乐家和从业者如何与这些系统进行交互,评估他们的满意度水平。我们开发了一个在线工具,用户可通过该工具生成音乐样本和/或应用最近提出的个性化技术(基于微调),以便文本到音乐模型生成更贴近用户需求和偏好的声音。通过半结构化访谈,我们分析了涉及参与者如何与所提出工具进行交互的各个方面,以了解文本到音乐模型在提升用户创造力方面的当前有效性和局限性。我们的研究聚焦于用户体验,以揭示可指导文本到音乐模型及其在 AI 驱动音乐创作中所扮演角色的未来发展的见解。此外,他们对潜在系统改进及其整合到音乐实践中的方式提供了具有洞察力的视角。通过该研究获得的结果揭示了使用文本到音乐模型进行创造活动的优缺点。参与者认识到该系统的创造潜力,并欣赏其个性化功能的实用性。然而,他们也识别出必须在文本到音乐模型准备好用于实际音乐创作之前必须解决的几个挑战,特别是提示模糊性、有限的可控性以及整合到现有工作流程中的问题。

关键词

引用

@article{arxiv.2407.04333,
  title  = {PAGURI: a user experience study of creative interaction with text-to-music models},
  author = {Francesca Ronchini and Luca Comanducci and Gabriele Perego and Fabio Antonacci},
  journal= {arXiv preprint arXiv:2407.04333},
  year   = {2025}
}