中文

LUMIA:面向实时、具身构作的手持式视觉到音乐系统

人机交互 2025-12-22 v1

摘要

大多数数字音乐工具强调精度和控制,却往往缺乏对基于环境互动的触感、即兴工作流程的支持。LUMIA 通过使用户“通过观察来构作”——将视觉场景转化为音乐短语——来弥补这一不足。系统采用手持式摄像界面和大型多模态模型,实现从视觉到音乐的转换。视觉语言模型(GPT-4V)分析捕获的图像,生成结构化提示;这些提示结合用户选择的乐器配置,指导文本到音乐管道(Stable Audio)。该实时过程允许用户以交互式方式构图、捕获和叠加音频,产生可循环的音乐片段。系统支持人类意图与模型推理共同构作的工作流程。通过将生成式 AI 嵌入物理设备,LUMIA 建立了感知与构作之间的桥梁,引入了一种新的创作模式,将视觉、语言和声音融合为一体。它重新定位了生成式音乐,不再是参数调谐的任务,而是一种由情境、感官参与驱动的即兴实践。

关键词

引用

@article{arxiv.2512.17228,
  title  = {LUMIA: A Handheld Vision-to-Music System for Real-Time, Embodied Composition},
  author = {Chung-Ta Huang and Connie Cheng and Vealy Lai},
  journal= {arXiv preprint arXiv:2512.17228},
  year   = {2025}
}

备注

6 pages, 15 pages with appendix, NeurIPS 2025 Creative AI track