通过训练中表征对齐学习紧凑特征
机器学习
2022-11-28 v1
摘要
用于监督学习的深度神经网络(DNNs)可视为特征提取器(即最后隐藏层)与线性分类器(即输出层)的流水线,二者通过随机梯度下降(SGD)在损失函数(如交叉熵)上联合训练。在每个轮次中,损失函数的真实梯度使用从训练集采样的小批量估计,然后模型参数以该小批量梯度更新。尽管后者对前者提供了无偏估计,但它们受源于所采样小批量的大小和数量的显著方差影响,导致更新含噪且跳跃。为稳定估计真实梯度时这种不良方差,我们提出训练中表征对齐(ITRA),其在 SGD 训练过程中以匹配损失显式对齐两个不同小批量的特征分布。我们还对匹配损失在特征表示学习上的期望效应给出严格分析:(1)提取紧凑特征表示;(2)通过自适应加权机制减少对小批量的过度适应;以及(3)适应多模态。最后,我们在图像与文本分类上开展大规模实验,以展示其相对于强基线的优越性能。
引用
@article{arxiv.2211.13332,
title = {Learning Compact Features via In-Training Representation Alignment},
author = {Xin Li and Xiangrui Li and Deng Pan and Yao Qiang and Dongxiao Zhu},
journal= {arXiv preprint arXiv:2211.13332},
year = {2022}
}
备注
11 pages, 4 figures, 6 tables. Accepted for publication by AAAI-23. arXiv admin note: text overlap with arXiv:2002.09917