中文

基于情景三元组挖掘的半监督少样本音频分类学习

声音 2021-02-17 v1 机器学习 音频与语音处理

摘要

少样本学习旨在泛化测试时出现但训练时不可用的未见类别。原型网络通过构建类内嵌入支持点的均值向量形式的类原型,实现了少样本度量学习。在极端少样本场景(如单样本)下,原型网络的性能急剧下降,主要由于在构建原型时忽视了类簇内部的变异。本文提出以情景三元组挖掘(ETM)技术替代典型的原型损失函数。常规三元组选择会导致过拟合,因为训练时使用了所有可能的组合。我们引入情景训练来挖掘半困难正三元组与半困难负三元组,以克服过拟合。我们还提出一种适配方法,以利用无标签训练样本实现更好的建模。在两个不同的音频处理任务(即说话人识别与音频事件检测)上的实验显示了性能提升,从而证明了 ETM 相对于原型损失函数及其他元学习框架的有效性。此外,我们展示了在使用无标签训练样本时性能的进一步提升。

关键词

引用

@article{arxiv.2102.08074,
  title  = {Semi Supervised Learning For Few-shot Audio Classification By Episodic Triplet Mining},
  author = {Swapnil Bhosale and Rupayan Chakraborty and Sunil Kumar Kopparapu},
  journal= {arXiv preprint arXiv:2102.08074},
  year   = {2021}
}

备注

5 pages