中文

多模态交响曲:通过生成式AI整合味觉与声音

声音 2025-09-01 v1 人工智能 多媒体 音频与语音处理

摘要

近几十年来,神经科学和心理学研究追溯了味觉与听觉感知之间的直接关系。本文探索了能够将味觉信息转化为音乐的多模态生成模型,在此基础上展开研究。我们简要回顾了该领域的最新进展,突出关键发现和方法论。我们展示了一个实验,其中对生成式音乐模型(MusicGEN)的微调版本被用于根据每首音乐作品提供的详细味觉描述来生成音乐。结果很有前景:根据参与者(n=111n=111)的评估,微调模型产生的音乐比未微调模型更连贯地反映了输入的味觉描述。本研究代表了理解和开发AI、声音与味觉之间具身交互的重要一步,为生成式AI领域开辟了新的可能性。我们在 https://osf.io/xs5jy/ 发布了我们的数据集、代码和预训练模型。

关键词

引用

@article{arxiv.2503.02823,
  title  = {A Multimodal Symphony: Integrating Taste and Sound through Generative AI},
  author = {Matteo Spanio and Massimiliano Zampini and Antonio Rodà and Franco Pierucci},
  journal= {arXiv preprint arXiv:2503.02823},
  year   = {2025}
}

备注

17 pages, 6 figures (2 + 2 figures with 2 subfigures each)