ACAVCaps:大规模训练的细粒度多样化音频理解
音频与语音处理
2026-03-26 v1 声音
摘要
通用音频理解是大型音频-语言模型的基本目标,音频描述作为其开发的核心任务。然而,现有数据集的局限使得该领域的进展受阻,缺乏训练真正通用模型所必需的规模和描述细粒度。为此,我们引入 ACAVCaps,一个新的大规模、细粒度、多维度的音频描述数据集。该数据集源自 ACAV100M 集合,通过多专家管道从多样化视角(包括语音、音乐和声学属性)分析音频,然后由大语言模型综合成详尽、细致的描述。实验结果表明,预训练于 ACAVCaps 的模型在各种下游任务上的泛化能力显著优于其他领先描述数据集训练的模型。数据集可在 https://github.com/xiaomi-research/acavcaps 获取。
引用
@article{arxiv.2603.24038,
title = {ACAVCaps: Enabling large-scale training for fine-grained and diverse audio understanding},
author = {Yadong Niu and Tianzi Wang and Heinrich Dinkel and Xingwei Sun and Jiahao Zhou and Gang Li and Jizhong Liu and Junbo Zhang and Jian Luan},
journal= {arXiv preprint arXiv:2603.24038},
year = {2026}
}
备注
accepted by ICASSP 2026