用于音乐到音乐视频描述生成的跨模态学习
声音
2025-03-17 v1 人工智能
计算与语言
多媒体
音频与语音处理
摘要
由于音乐与视频模态之间的内在差异,音乐到音乐视频的生成是一项具有挑战性的任务。强大的文本到视频扩散模型的出现,为音乐视频(MV)的生成开辟了一条充满希望的途径:首先解决音乐到 MV 描述的任务,随后利用这些模型进行视频生成。在本研究中,我们聚焦于 MV 描述生成任务,并提出了一条包含训练数据构建和多模态模型微调的综合流水线。我们基于 Music4All 数据集构建了全新的音乐到 MV 描述数据集,并在此基础上对现有的预训练多模态模型进行了微调,该数据集整合了音乐与视觉信息。我们的实验结果表明,音乐表征可以有效地映射到文本域,从而能够直接从音乐输入生成有意义的 MV 描述。我们还识别了数据集构建流水线中对 MV 描述质量产生关键影响的核心组件,并强调了为改进 MV 描述生成而值得更多关注的特定音乐属性。
引用
@article{arxiv.2503.11190,
title = {Cross-Modal Learning for Music-to-Music-Video Description Generation},
author = {Zhuoyuan Mao and Mengjie Zhao and Qiyu Wu and Zhi Zhong and Wei-Hsiang Liao and Hiromi Wakaki and Yuki Mitsufuji},
journal= {arXiv preprint arXiv:2503.11190},
year = {2025}
}
备注
Accepted by RepL4NLP 2025 @ NAACL 2025