中文

通过训练中表征对齐学习紧凑特征

机器学习 2022-11-28 v1

摘要

用于监督学习的深度神经网络(DNNs)可视为特征提取器(即最后隐藏层)与线性分类器(即输出层)的流水线,二者通过随机梯度下降(SGD)在损失函数(如交叉熵)上联合训练。在每个轮次中,损失函数的真实梯度使用从训练集采样的小批量估计,然后模型参数以该小批量梯度更新。尽管后者对前者提供了无偏估计,但它们受源于所采样小批量的大小和数量的显著方差影响,导致更新含噪且跳跃。为稳定估计真实梯度时这种不良方差,我们提出训练中表征对齐(ITRA),其在 SGD 训练过程中以匹配损失显式对齐两个不同小批量的特征分布。我们还对匹配损失在特征表示学习上的期望效应给出严格分析:(1)提取紧凑特征表示;(2)通过自适应加权机制减少对小批量的过度适应;以及(3)适应多模态。最后,我们在图像与文本分类上开展大规模实验,以展示其相对于强基线的优越性能。

关键词

引用

@article{arxiv.2211.13332,
  title  = {Learning Compact Features via In-Training Representation Alignment},
  author = {Xin Li and Xiangrui Li and Deng Pan and Yao Qiang and Dongxiao Zhu},
  journal= {arXiv preprint arXiv:2211.13332},
  year   = {2022}
}

备注

11 pages, 4 figures, 6 tables. Accepted for publication by AAAI-23. arXiv admin note: text overlap with arXiv:2002.09917