教我如何插值无数个嵌入
机器学习
2022-07-01 v1 计算机视觉与模式识别
摘要
Mixup 指的是基于插值的的数据增强,其最初动机是超越经验风险最小化(ERM)。然而,其扩展集中于插值的定义与插值所在空间,而增强本身较少被研究:对于大小为 的小批量,多数方法以单一标量插值因子 在 对之间插值。本文在该方向上取得进展,引入 MultiMix,其以每个元组一个向量 对任意数量 个长度均为 的元组进行插值。在序列数据上,我们进一步扩展至稠密插值及在所有空间位置上的损失计算。总体而言,我们以极小的额外代价将每小批量的元组数量提升了数个数量级。这通过在分类器前最后一层进行插值得以实现。最后,为解决线性目标插值导致的不一致性,我们引入一种自蒸馏方法以生成并插值合成目标。我们通过实验表明,在四个基准上,我们的贡献相较最先进的 mixup 方法取得显著改进。通过分析嵌入空间,我们观察到各类别在嵌入空间中聚类更紧密且分布更均匀,从而解释了改进的行为。
引用
@article{arxiv.2206.14868,
title = {Teach me how to Interpolate a Myriad of Embeddings},
author = {Shashanka Venkataramanan and Ewa Kijak and Laurent Amsaleg and Yannis Avrithis},
journal= {arXiv preprint arXiv:2206.14868},
year = {2022}
}