中文

利用深度网络优化不可分解度量

机器学习 2021-09-22 v1 机器学习

摘要

我们提出了一类算法,能够直接针对大量任务特定的性能度量(如结构化的、不可分解的 F-measure 与 Kullback-Leibler 散度)来训练深度神经网络。这与通常使用平方损失或交叉熵损失函数(可分解的)来训练神经网络的标准深度学习技术有所不同。我们证明,直接使用任务特定的损失函数进行训练,在各类问题与数据集上能带来更快且更稳定的收敛。我们提出的算法与实现具有若干新颖特性,包括:(i) 尽管优化复杂的目标函数,仍收敛至一阶驻点;(ii) 使用更少的训练样本即可达到所需的收敛水平;(iii) 大幅减少训练时间;(iv) 将我们的实现无缝集成到现有的符号梯度框架中。我们在多种深度架构(包括多层感知机与循环神经网络)上实现了我们的技术,并在多种基准与真实数据集上表明,我们的算法优于传统的深度网络训练方法,以及一些近期的神经网络任务特定训练方法。

关键词

引用

@article{arxiv.1802.00086,
  title  = {Optimizing Non-decomposable Measures with Deep Networks},
  author = {Amartya Sanyal and Pawan Kumar and Purushottam Kar and Sanjay Chawla and Fabrizio Sebastiani},
  journal= {arXiv preprint arXiv:1802.00086},
  year   = {2021}
}