中文

教我如何插值无数个嵌入

机器学习 2022-07-01 v1 计算机视觉与模式识别

摘要

Mixup 指的是基于插值的的数据增强,其最初动机是超越经验风险最小化(ERM)。然而,其扩展集中于插值的定义与插值所在空间,而增强本身较少被研究:对于大小为 mm 的小批量,多数方法以单一标量插值因子 λ\lambdamm 对之间插值。本文在该方向上取得进展,引入 MultiMix,其以每个元组一个向量 λ\lambda 对任意数量 nn 个长度均为 mm 的元组进行插值。在序列数据上,我们进一步扩展至稠密插值及在所有空间位置上的损失计算。总体而言,我们以极小的额外代价将每小批量的元组数量提升了数个数量级。这通过在分类器前最后一层进行插值得以实现。最后,为解决线性目标插值导致的不一致性,我们引入一种自蒸馏方法以生成并插值合成目标。我们通过实验表明,在四个基准上,我们的贡献相较最先进的 mixup 方法取得显著改进。通过分析嵌入空间,我们观察到各类别在嵌入空间中聚类更紧密且分布更均匀,从而解释了改进的行为。

关键词

引用

@article{arxiv.2206.14868,
  title  = {Teach me how to Interpolate a Myriad of Embeddings},
  author = {Shashanka Venkataramanan and Ewa Kijak and Laurent Amsaleg and Yannis Avrithis},
  journal= {arXiv preprint arXiv:2206.14868},
  year   = {2022}
}