FusionAudio-1.2M:面向细粒度音频字幕生成的多模态上下文融合
声音
2025-06-03 v1 人工智能
音频与语音处理
摘要
高质量、大规模的音频字幕生成对推进音频理解至关重要,然而当前的自动方法生成的字幕往往缺乏细粒度细节和上下文准确性,这主要归因于它们依赖有限的单模态或浅层多模态信息。受人类听觉感知的启发——其能够巧妙整合跨模态线索并进行复杂的听觉场景分析——我们引入了一种新颖的两阶段自动流水线。该流水线首先采用专门的预训练模型来提取多样化的上下文线索(例如,语音、音乐、一般声音以及来自关联视频的视觉信息)。随后,大型语言模型(LLM)综合这些丰富的多模态输入,生成详细且具备上下文感知的音频字幕。本工作的主要贡献包括: 所提出的用于细粒度音频字幕生成的可扩展方法; FusionAudio,一个新的大规模数据集,包含 120 万条此类详细字幕,以及 600 万个问答对; 使用 FusionAudio 开发的增强型音频模型,具体为具有卓越音频-文本对齐和指令遵循能力的基于 CLAP 的音频编码器。本文为更细致、更准确地自动理解复杂音频环境铺平了道路。代码和数据可在 https://github.com/satsuki2486441738/FusionAudio 获取。
引用
@article{arxiv.2506.01111,
title = {FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion},
author = {Shunian Chen and Xinyuan Xie and Zheshu Chen and Liyan Zhao and Owen Lee and Zhan Su and Qilin Sun and Benyou Wang},
journal= {arXiv preprint arXiv:2506.01111},
year = {2025}
}