基于情景三元组挖掘的半监督少样本音频分类学习
声音
2021-02-17 v1 机器学习
音频与语音处理
摘要
少样本学习旨在泛化测试时出现但训练时不可用的未见类别。原型网络通过构建类内嵌入支持点的均值向量形式的类原型,实现了少样本度量学习。在极端少样本场景(如单样本)下,原型网络的性能急剧下降,主要由于在构建原型时忽视了类簇内部的变异。本文提出以情景三元组挖掘(ETM)技术替代典型的原型损失函数。常规三元组选择会导致过拟合,因为训练时使用了所有可能的组合。我们引入情景训练来挖掘半困难正三元组与半困难负三元组,以克服过拟合。我们还提出一种适配方法,以利用无标签训练样本实现更好的建模。在两个不同的音频处理任务(即说话人识别与音频事件检测)上的实验显示了性能提升,从而证明了 ETM 相对于原型损失函数及其他元学习框架的有效性。此外,我们展示了在使用无标签训练样本时性能的进一步提升。
引用
@article{arxiv.2102.08074,
title = {Semi Supervised Learning For Few-shot Audio Classification By Episodic Triplet Mining},
author = {Swapnil Bhosale and Rupayan Chakraborty and Sunil Kumar Kopparapu},
journal= {arXiv preprint arXiv:2102.08074},
year = {2021}
}
备注
5 pages