中文

面向日本漫画的多模态背景音乐自动生成框架——M2M-Gen

声音 2024-10-15 v1 人工智能 音频与语音处理

摘要

本文介绍了 M2M Gen,一个用于为日本漫画生成背景音乐的多模态框架。该任务的关键挑战是缺乏可用数据集或基准模型。为此,我们提出了一个自动化音乐生成管道,用于为输入漫画书生成背景音乐。初始阶段,我们使用漫画中的对话检测场景边界,并通过场景中人物面部进行情感分类。随后,我们使用 GPT-4o 将这种低层次场景信息翻译为高层次音乐指令。以场景信息和音乐指令为条件,另一个 GPT-4o 实例生成页面级音乐说明,以指导文本到音乐模型。此过程产生与漫画叙事演变相匹配的音乐。通过大规模主观评估,我们确认了 M2M Gen 的有效性,展示了其在生成更高质量、更相关且在特定场景下更一致的音乐方面的能力,与我们的基线方法相比更具针对性。

关键词

引用

@article{arxiv.2410.09928,
  title  = {M2M-Gen: A Multimodal Framework for Automated Background Music Generation in Japanese Manga Using Large Language Models},
  author = {Megha Sharma and Muhammad Taimoor Haseeb and Gus Xia and Yoshimasa Tsuruoka},
  journal= {arXiv preprint arXiv:2410.09928},
  year   = {2024}
}