中文

面向音频标注的本体感知学习与评估

音频与语音处理 2023-10-10 v1 人工智能 机器学习 声音 信号处理

摘要

本研究为音频标注任务定义了一种新的评估指标,以克服传统平均精度均值(mAP)指标的局限——该指标将不同种类的声音视为独立类别,未考虑其相互关系。此外,由于声音标注存在模糊性,训练集与评估集中的标签无法保证准确且完备,这给基于 mAP 的鲁棒评估带来了挑战。所提出的指标——本体感知平均精度均值(OmAP)——通过在评估中利用 AudioSet 本体信息,解决了 mAP 的缺陷。具体而言,我们基于本体图到目标类别的距离,对模型预测中的假正类事件进行重加权。OmAP 度量还通过在本体图中不同粗粒度层级上的评估,提供了对模型性能的更多洞察。我们进行了人工评估,并证明 OmAP 比 mAP 更符合人类感知。为进一步验证利用本体信息的重要性,我们还提出了一种新颖的损失函数(OBCE),其基于本体距离对二元交叉熵(BCE)损失进行重加权。我们的实验表明,在 AudioSet 标注任务上,OBCE 能同时提升 mAP 与 OmAP 指标。

关键词

引用

@article{arxiv.2211.12195,
  title  = {Ontology-aware Learning and Evaluation for Audio Tagging},
  author = {Haohe Liu and Qiuqiang Kong and Xubo Liu and Xinhao Mei and Wenwu Wang and Mark D. Plumbley},
  journal= {arXiv preprint arXiv:2211.12195},
  year   = {2023}
}

备注

Submitted to ICASSP 2023. The code is open-sourced at https://github.com/haoheliu/ontology-aware-audio-tagging