面向声学场景分类的长时声音鲁棒特征学习
声音
2021-08-12 v1 人工智能
摘要
声学场景分类(ASC)旨在识别给定音频信号所录制的场景(环境)类型。log-mel 特征与卷积神经网络(CNN)近来已成为 ASC 中最流行的时频(TF)特征表示与分类器。场景中录制的音频信号可能包含在时间与频率上重叠的各种声音。先前的研究表明,在 CNN 中分别考虑长时声音与短时声音可提升 ASC 准确率。本研究解决声学场景分类器的泛化能力问题。实践中,声学场景信号的特征可能受多种因素影响,如录制设备的选择与录制地点的变化。当已建立的 ASC 系统对未见场景下录制的音频预测场景类别时,其准确率可能显著下降。长时声音不仅包含与领域无关的声学场景信息,还包含由录制条件决定的信道信息,易于过拟合。为获得更鲁棒的 ASC 系统,我们提出一种鲁棒特征学习(RFL)框架来训练 CNN。RFL 框架降低 CNN 在长时声音上的特定学习权重。所提方法以仅含长时声音信息作为输入训练一个辅助分类器。该辅助分类器以辅助损失函数训练,该损失函数对难分类样本赋予比标准交叉熵损失更小的学习权重。实验结果表明,所提 RFL 框架能获得面向未见设备与城市的更鲁棒声学场景分类器。
引用
@article{arxiv.2108.05008,
title = {Robust Feature Learning on Long-Duration Sounds for Acoustic Scene Classification},
author = {Yuzhong Wu and Tan Lee},
journal= {arXiv preprint arXiv:2108.05008},
year = {2021}
}