对比式环境声音表示学习
声音
2022-07-20 v1 人工智能
机器学习
音频与语音处理
摘要
环境声音的机器听觉是音频识别领域的重要问题之一。它赋予机器区分不同输入声音的能力,从而指导其决策。在本工作中,我们利用自监督对比技术和浅层 1D CNN 来提取区分性音频特征(音频表示),而不使用任何显式标注。我们使用给定音频的原始波形和频谱图生成其表示,并评估所提出的 learner 是否与音频输入类型无关。我们进一步使用典型相关分析(CCA)融合给定音频两类输入的表示,并证明与单独表示相比,融合的全局特征能得到更鲁棒的音频信号表示。所提技术在 ESC-50 和 UrbanSound8K 上进行了评估。结果表明,所提技术能够提取环境音频的大部分特征,并在 ESC-50 和 UrbanSound8K 数据集上分别带来 12.8% 和 0.9% 的提升。
引用
@article{arxiv.2207.08825,
title = {Contrastive Environmental Sound Representation Learning},
author = {Peter Ochieng and Dennis Kaburu},
journal= {arXiv preprint arXiv:2207.08825},
year = {2022}
}