一种可解释的多标签音频分割代理模型
音频与语音处理
2024-01-18 v2 人工智能
机器学习
声音
信号处理
摘要
音频信号分割是自动音频索引的关键任务,它涉及检测信号中类别同质片段的边界。在许多应用中,可解释人工智能是机器学习决策透明化的重要过程。本文提出了一种可解释的多标签分割模型,可同时解决语音活动检测(SAD)、音乐检测(MD)、噪声检测(ND)和重叠语音检测(OSD)。该代理模型使用非负矩阵分解(NMF)将用于分割的嵌入映射到频域。在两个数据集上进行的实验表明,该模型在表现出强可解释性特征的同时,性能与预训练的黑盒模型相当。具体而言,用于决策的频段可以在片段级别(局部解释)和全局级别(类别原型)轻松识别。
引用
@article{arxiv.2401.08268,
title = {An Explainable Proxy Model for Multiabel Audio Segmentation},
author = {Théo Mariotte and Antonio Almudévar and Marie Tahon and Alfonso Ortega},
journal= {arXiv preprint arXiv:2401.08268},
year = {2024}
}
备注
Accepted at ICASSP 2024