中文

一种可解释的多标签音频分割代理模型

音频与语音处理 2024-01-18 v2 人工智能 机器学习 声音 信号处理

摘要

音频信号分割是自动音频索引的关键任务,它涉及检测信号中类别同质片段的边界。在许多应用中,可解释人工智能是机器学习决策透明化的重要过程。本文提出了一种可解释的多标签分割模型,可同时解决语音活动检测(SAD)、音乐检测(MD)、噪声检测(ND)和重叠语音检测(OSD)。该代理模型使用非负矩阵分解(NMF)将用于分割的嵌入映射到频域。在两个数据集上进行的实验表明,该模型在表现出强可解释性特征的同时,性能与预训练的黑盒模型相当。具体而言,用于决策的频段可以在片段级别(局部解释)和全局级别(类别原型)轻松识别。

关键词

引用

@article{arxiv.2401.08268,
  title  = {An Explainable Proxy Model for Multiabel Audio Segmentation},
  author = {Théo Mariotte and Antonio Almudévar and Marie Tahon and Alfonso Ortega},
  journal= {arXiv preprint arXiv:2401.08268},
  year   = {2024}
}

备注

Accepted at ICASSP 2024