中文

神经网络训练与非可微目标函数

计算机视觉与模式识别 2023-05-04 v1

摘要

许多重要的计算机视觉任务天然地被表述为具有非可微目标。因此,由于反向传播需要目标关于模型输出的梯度,神经网络的标准主导训练流程并不适用。大多数深度学习方法通过为训练使用代理损失(proxy loss)来次优地回避该问题,该代理损失原本为另一任务设计,并未针对目标的具体特性定制。代理损失函数可能与原始非可微目标吻合良好,也可能并不吻合。对于新任务必须设计合适的代理函数,这对非专业人员而言可能不可行。本论文为弥合非可微目标与训练损失函数之间的差距做出四项主要贡献。贯穿全文,若某损失函数是非可微目标的可微近似,我们称之为代理损失(surrogate loss)。请注意,我们交替使用术语“目标”和“评估指标”。本论文的贡献使神经网络的训练更具可扩展性——当评估指标可分解时,能以近乎无人工的方式扩展到新任务,这将帮助面临新任务的研究者。对于不可分解的评估指标,为 recall@k 代理损失开发的可微组件(如排序与计数)也可用于创建新的代理损失。

关键词

引用

@article{arxiv.2305.02024,
  title  = {Neural Network Training and Non-Differentiable Objective Functions},
  author = {Yash Patel},
  journal= {arXiv preprint arXiv:2305.02024},
  year   = {2023}
}

备注

Ph.D. Dissertation (under review). Supervisor: Prof. Jiri Matas