AudioSet-R:基于多阶段 LLM 标签重新标注的精炼版 AudioSet
声音
2025-08-25 v1
摘要
AudioSet 是音频研究领域中广泛使用的基准数据集,已显著推动了各种音频相关任务的发展。然而,标签准确性和完整性仍存若干问题,成为下游应用性能的关键瓶颈。为此,我们提出了一个三阶段重新标注框架,利用通用音频语言基础模型系统性地提高 AudioSet 的标签质量。该框架采用跨模态提示策略,灵感来源于提示链(prompt chaining)概念,即顺序组合提示以执行子任务(音频理解、标签综合和语义对齐)。借助该框架,我们构建了一个高质量、结构化的 AudioSet 重新标注版本(AudioSet-R)。对代表性音频分类模型(包括 AST、PANNs、SSAST 和 AudioMAE)进行的大量实验一致显示,显著提升了性能,验证了该方法在提升标签可靠性方面的通用性和有效性。代码已公开:https://github.com/colaudiolab/AudioSet-R。
引用
@article{arxiv.2508.15429,
title = {AudioSet-R: A Refined AudioSet with Multi-Stage LLM Label Reannotation},
author = {Yulin Sun and Qisheng Xu and Yi Su and Qian Zhu and Yong Dou and Xinwang Liu and Kele Xu},
journal= {arXiv preprint arXiv:2508.15429},
year = {2025}
}
备注
8 pages, 5 figures, accepted in ACM MM 2025 dataset track