用于音频指纹识别的对比无监督学习
声音
2020-10-27 v1 机器学习
多媒体
音频与语音处理
摘要
视频分享平台的兴起吸引了越来越多人拍摄视频并上传至互联网。这些视频大多包含精心编辑的背景音轨,其中可能涉及严重的语音变换、变调以及各种音频效果,现有音频识别系统可能无法识别这些音频。为解决该问题,本文将对比学习的思想引入音频指纹识别(AFP)任务。对比学习是一种无监督方法,可学习到能有效将相似样本聚拢、将不相似样本区分的表示。在我们的工作中,我们将一条音轨及其不同失真版本视为相似,而将不同音轨视为不相似。基于动量对比(MoCo)框架,我们设计了一种用于 AFP 的对比学习方法,可生成既具区分性又具鲁棒性的指纹。一组实验表明,我们的 AFP 方法对音频识别有效,且对严重音频失真(包括极具挑战的速度改变与变调)具有鲁棒性。
引用
@article{arxiv.2010.13540,
title = {Contrastive Unsupervised Learning for Audio Fingerprinting},
author = {Zhesong Yu and Xingjian Du and Bilei Zhu and Zejun Ma},
journal= {arXiv preprint arXiv:2010.13540},
year = {2020}
}
备注
5 pages