巧合、分类与巩固:以极小监督学习识别声音
声音
2019-11-15 v1 音频与语音处理
机器学习
摘要
人类获取感知能力的方式不同于我们训练机器的方式。虽然机器学习算法通常在大量随机选取、显式标注的样本上运作,人类的习得更依赖于多模态无监督学习(如婴儿期)和主动学习(如儿童期)。受此启发,我们提出了一个声音表征与识别的学习框架,它结合了(i)基于单模态与跨模态巧合这一通用概念的自监督目标,(ii)反映我们将范畴结构强加于经验之上的聚类目标,以及(iii)基于聚类的主动学习过程,该过程征求有针对性的弱监督以将类别巩固为相关的语义类。依据这些准则训练一个联合的声音嵌入/聚类/分类网络,我们实现了一种新的最先进(SOTA)无监督音频表征,并展示了达到期望分类性能所需标签数量最多减少 20 倍。
引用
@article{arxiv.1911.05894,
title = {Coincidence, Categorization, and Consolidation: Learning to Recognize Sounds with Minimal Supervision},
author = {Aren Jansen and Daniel P. W. Ellis and Shawn Hershey and R. Channing Moore and Manoj Plakal and Ashok C. Popat and Rif A. Saurous},
journal= {arXiv preprint arXiv:1911.05894},
year = {2019}
}
备注
This extended version of a ICASSP 2020 submission under same title has an added figure and additional discussion for easier consumption