中文

Mozualization:利用多模态 AI 创作音乐与视觉表征

人机交互 2025-04-22 v1 人工智能

摘要

本文介绍了 Mozualization,这是一个集成多种输入(如关键词、图像和声音片段——例如来自不同音乐作品的片段,甚至一段调皮的猫叫)的音乐生成与编辑工具。我们的工作灵感来自人们表达情感的方式——写情绪描述性的诗歌或文章、创作使用温暖或冷却色调的绘画,或聆听悲伤或振奋的音乐。基于此概念,我们开发了一个工具,将这些情感表达转化为连贯且富有表现力的歌曲,使用户能够无缝地融入自己的独特偏好和灵感。为评估该工具且更重要的是收集改进见识,我们组织了九位音乐爱好者的用户研究。该研究评估了用户体验、参与度以及与生成音乐的互动和聆听影响。

关键词

引用

@article{arxiv.2504.13891,
  title  = {Mozualization: Crafting Music and Visual Representation with Multimodal AI},
  author = {Wanfang Xu and Lixiang Zhao and Haiwen Song and Xinheng Song and Zhaolin Lu and Yu Liu and Min Chen and Eng Gee Lim and Lingyun Yu},
  journal= {arXiv preprint arXiv:2504.13891},
  year   = {2025}
}

备注

7 pages, 5 figures, CHI2025