度量学习的统一互信息视角:交叉熵与成对损失之比较
机器学习
2021-11-29 v3 计算机视觉与模式识别
机器学习
摘要
近来,深度度量学习(DML)的大量研究工作集中于设计复杂的成对距离损失,其需要繁琐的优化方案(如样本挖掘或样本对加权)以缓解优化困难。标准的分类交叉熵损失在 DML 中很大程度上被忽视。表面上,交叉熵似乎与度量学习无关,因其未显式涉及成对距离。然而,我们提供了将交叉熵与若干知名及近期成对损失相联系的理论分析。我们的联系从两个不同视角得出:一个基于显式优化洞察;另一个基于标签与所学特征之间互信息的判别性与生成性视角。首先,我们显式证明交叉熵是一种新成对损失的上界,该损失具有与多种成对损失相似的结构:它最小化类内距离同时最大化类间距离。因此,最小化交叉熵可视为最小化该成对损失的近似界优化(或 Majorize-Minimize)算法。其次,我们表明更一般地,最小化交叉熵实际上等价于最大化互信息,我们并将若干知名成对损失与之联系。此外,我们展示各种标准成对损失可通过界关系显式相互关联。我们的发现表明,交叉熵代表了最大化互信息的代理——正如成对损失那样——而无需繁琐的样本挖掘启发式方法。我们在四个标准 DML 基准上的实验强有力地支持我们的发现。我们取得了最先进结果,优于近期复杂的 DML 方法。
引用
@article{arxiv.2003.08983,
title = {A unifying mutual information view of metric learning: cross-entropy vs. pairwise losses},
author = {Malik Boudiaf and Jérôme Rony and Imtiaz Masud Ziko and Eric Granger and Marco Pedersoli and Pablo Piantanida and Ismail Ben Ayed},
journal= {arXiv preprint arXiv:2003.08983},
year = {2021}
}
备注
ECCV 2020 (Spotlight) - Code available at: https://github.com/jeromerony/dml_cross_entropy