层次标签传播:一种模型大小依赖的AudioSet标注性能提升方法
声音
2025-03-31 v1 机器学习
音频与语音处理
摘要
AudioSet是音频标注中使用最广泛且规模最大的数据集之一,包含约200万个音频样本,这些样本按照包含527个事件类别(组织成本体)进行了人工标注。然而,标注存在不一致性,特别是那些根据本体应标记为正例的类别经常被错误地标记为负例。为了解决这个问题,我们应用了层次标签传播(HLP),该方法沿本体层次向上传播标签,导致每个音频片段的正标签平均数量从1.98增加到2.39,并影响了527个类别中的109个。我们的结果表明,HLP在各种模型架构(包括卷积神经网络(PANN的CNN6和ConvNeXT)和Transformer(PaSST))上均能带来性能提升,且较小的模型改进更明显。最后,在另一个广泛使用的数据集FSD50K上,使用HLP在AudioSet上训练的模型始终优于未使用HLP训练的模型。我们的源代码将在GitHub上提供。
引用
@article{arxiv.2503.21826,
title = {Hierarchical Label Propagation: A Model-Size-Dependent Performance Booster for AudioSet Tagging},
author = {Ludovic Tuncay and Etienne Labbé and Thomas Pellegrini},
journal= {arXiv preprint arXiv:2503.21826},
year = {2025}
}