基于时间注意力的多标签零样本音频分类
声音
2024-09-04 v1 机器学习
音频与语音处理
摘要
零样本学习模型能够通过利用辅助信息从已见类别迁移知识来对新类别进行分类。虽然现有的大多数零样本学习方法都专注于单标签分类任务,但本研究引入了一种执行多标签零样本音频分类的方法。为了解决在对未见类别进行泛化的同时对多标签声音进行分类的挑战,我们采用了时间注意力机制。时间注意力机制根据不同音频片段的声学和语义兼容性为其分配重要性权重,从而使模型能够通过关注与每个类别最相关的片段来捕捉音频样本中不同声音类别变化的主导地位。与使用均匀聚合的声学特征(平等对待所有音频片段)的方法相比,这导致了更准确的多标签零样本分类。我们在 AudioSet 的一个子集上评估了我们的方法,并与使用均匀聚合声学特征的零样本模型、零规则基线以及所提方法在有监督场景下的表现进行了对比。结果表明,时间注意力增强了多标签场景下的零样本音频分类性能。
引用
@article{arxiv.2409.00408,
title = {Multi-label Zero-Shot Audio Classification with Temporal Attention},
author = {Duygu Dogan and Huang Xie and Toni Heittola and Tuomas Virtanen},
journal= {arXiv preprint arXiv:2409.00408},
year = {2024}
}
备注
Accepted to International Workshop on Acoustic Signal Enhancement (IWAENC) 2024