MuDiT & MuSiT:描述到歌曲生成中与口语表达的匹配
声音
2024-07-12 v2 人工智能
多媒体
音频与语音处理
摘要
在生成式 AI 与人类艺术过程日益交融的背景下,本研究探讨了以人为中心的自动歌曲创作中匹配这一关键但较少被探索的领域。我们提出了一项“口语描述到歌曲生成”的新颖任务,重点关注生成内容与人类口语表达的匹配。该任务旨在弥合 AI 模型中口语语言理解与听觉表达之间的鸿沟,最终目标是创作出准确满足人类听觉期望并在结构上符合音乐规范的歌曲。由于描述范围狭窄、语义鸿沟和不准确,当前的数据集存在局限性。为了克服该领域的数据稀缺问题,我们提出了 Caichong Music Dataset (CaiMD)。CaiMD 由专业音乐家和业余爱好者共同手动标注,提供了多样化的视角和对口语描述的全面理解。与预设专家标注或带有固有偏差的自动生成的现有数据集不同,CaiMD 更充分地满足了我们将 AI 生成音乐与广泛用户期望结果相匹配的目的。此外,我们提出了一种名为 MuDiT/MuSiT 的创新单阶段框架,以在歌曲创作中实现有效的人机匹配。该框架不仅实现了口语语言与听觉音乐感知之间的跨模态理解,还确保了生成的歌曲与用户期望的结果相匹配。MuDiT/MuSiT 采用一个 DiT/SiT 模型,对旋律、和声、节奏、人声和乐器等音乐组件进行端到端生成。该方法确保了所有生成音乐组件之间和谐的听觉一致性,从而更好地与人类听觉期望产生共鸣。
引用
@article{arxiv.2407.03188,
title = {MuDiT & MuSiT: Alignment with Colloquial Expression in Description-to-Song Generation},
author = {Zihao Wang and Haoxuan Liu and Jiaxing Yu and Tao Zhang and Yan Liu and Kejun Zhang},
journal= {arXiv preprint arXiv:2407.03188},
year = {2024}
}
备注
19 pages, 5 figures