基于渐进训练的广义由粗到细视觉识别
计算机视觉与模式识别
2019-04-17 v2
摘要
计算机视觉是困难的,部分原因在于连接输入与输出数据的期望数学函数往往复杂、模糊,因而难以学习。由粗到细(Coarse-to-Fine, C2F)学习是一个有前景的方向,但如何将其应用于广泛的视觉问题仍不清楚。本文通过两项技术贡献提出了一个广义的 C2F 框架。首先,我们给出了一种统一的 C2F 传播方式,其中粗预测(类别向量、检测框、分割掩码等)被编码为稠密(像素级)矩阵并与原始输入拼接,从而细模型采用与粗模型相同的结构但能看到额外信息。其次,我们提出了一种渐进训练策略,该策略起初将真实标注而非粗输出送入细模型,并逐步增大粗输出的比例,使得在训练结束时细模型已可用于测试。我们还将我们的方法与课程学习相联系,表明数据难度在训练过程中持续增加。我们将该框架应用于包括图像分类、目标定位和语义分割在内的三项视觉任务,并展示出相较于基线训练策略一致的准确率提升。
引用
@article{arxiv.1811.12047,
title = {Generalized Coarse-to-Fine Visual Recognition with Progressive Training},
author = {Xutong Ren and Lingxi Xie and Chen Wei and Siyuan Qiao and Chi Su and Jiaying Liu and Qi Tian and Elliot K. Fishman and Alan L. Yuille},
journal= {arXiv preprint arXiv:1811.12047},
year = {2019}
}