基于实例级损失的多种实例学习框架用于声学场景分类
声音
2022-07-01 v2 音频与语音处理
摘要
在声学场景分类(ASC)任务中,一个声学场景由多种声音组成,并通过识别其中不同属性的组合来推断。本研究旨在使用一种改进的多种实例学习(MIL)框架来有效提取并聚类这些属性以用于 ASC。MIL 作为一种弱监督学习方法,是一种从组成输入音频片段的一束帧中提取实例,并利用这些未标记实例推断对应于输入数据的场景的策略。然而,许多研究指出了 MIL 的低估问题。在本研究中,我们通过定义实例级标签和损失来有效提取和聚类实例,从而开发了一个更适用于 ASC 系统的 MIL 框架。此外,我们设计了一个完全分离卷积模块,这是一个由逐点、频侧深度可分离和时侧深度可分离卷积滤波器组成的轻量级神经网络。结果表明,与原始 MIL 相比,正实例的置信度和比例显著提升,克服了低估问题,并将分类准确率提高了至多 11%。所提系统在 TAU 城市声学场景 2019 和 2020 移动数据集上分别以 139K 参数取得了 81.1% 和 72.3% 的性能。特别是在 TAU 城市声学场景 2019 数据集上,它在参数量低于 1M 的系统中取得了最高性能。
引用
@article{arxiv.2203.08439,
title = {Instance-level loss based multiple-instance learning framework for acoustic scene classification},
author = {Won-Gook Choi and Joon-Hyuk Chang and Jae-Mo Yang and Han-Gil Moon},
journal= {arXiv preprint arXiv:2203.08439},
year = {2022}
}