面向音频分类的特征信息嵌入空间正则化
音频与语音处理
2022-06-13 v1 声音
摘要
从大规模数据集上预训练的模型导出的特征表示已在多种音频分析任务上展现出泛化能力。然而,尽管具有这种泛化性,若有充足训练数据,任务特定特征可学得特定任务相关属性从而表现更优。此外,复杂的预训练模型在推理时带来可观的计算负担。我们提出通过引入两种正则化方法,将谱图输入得到的细致任务特定特征与通用预训练特征相结合,以利用这两类特征信息。由于预训练特征仅用于训练,推理时计算量保持较低。在使用预训练特征 VGGish、OpenL3 及二者组合的实验中,我们表明所提方法不仅优于基线方法,还能在若干音频分类任务上改进 SOTA 模型。结果还表明,使用特征混合比使用单个特征表现更好。
引用
@article{arxiv.2206.04850,
title = {Feature-informed Embedding Space Regularization For Audio Classification},
author = {Yun-Ning Hung and Alexander Lerch},
journal= {arXiv preprint arXiv:2206.04850},
year = {2022}
}