MINT:用于拟音音频内容规划与生成的多模态图像与叙事文本配音数据集
音频与语音处理
2024-06-18 v1 人工智能
计算机视觉与模式识别
多媒体
声音
摘要
拟音音频对于增强多媒体内容的沉浸式体验至关重要,但在人工智能生成内容(AIGC)领域面临重大挑战。尽管文本和图像生成的AIGC技术取得了进步,但由于跨模态场景匹配和内容关联的困难,拟音音频配音仍然处于初级阶段。当前依赖于详细且声学相关文本描述的文本到音频技术,在实际视频配音应用中存在不足。现有的数据集如AudioSet、AudioCaps、Clotho、Sound-of-Story和WavCaps未能完全满足真实世界拟音音频配音任务的要求。为解决这一问题,我们引入了多模态图像与叙事文本配音数据集(MINT),旨在增强主流配音任务,如文学故事有声书配音、图像/无声视频配音。此外,为解决现有TTA技术在理解和规划复杂提示方面的局限性,提出了一个拟音音频内容规划、生成与对齐(CPGA)框架,该框架包括一个利用大型语言模型进行复杂多模态提示理解的内容规划模块。此外,使用基于近端策略优化的强化学习优化训练过程,显著提高了生成拟音音频的对齐度和听觉真实感。实验结果表明,我们的方法显著推进了拟音音频配音领域,为多模态配音的挑战提供了稳健的解决方案。即使使用相对轻量级的GPT-2模型,我们的框架也优于开源多模态大模型,如LLaVA、DeepSeek-VL和Moondream2。该数据集可在https://github.com/borisfrb/MINT获取。
引用
@article{arxiv.2406.10591,
title = {MINT: a Multi-modal Image and Narrative Text Dubbing Dataset for Foley Audio Content Planning and Generation},
author = {Ruibo Fu and Shuchen Shi and Hongming Guo and Tao Wang and Chunyu Qiang and Zhengqi Wen and Jianhua Tao and Xin Qi and Yi Lu and Xiaopeng Wang and Zhiyong Wang and Yukun Liu and Xuefei Liu and Shuai Zhang and Guanjun Li},
journal= {arXiv preprint arXiv:2406.10591},
year = {2024}
}