ScaleNAS:用于视觉识别的尺度感知表征一次性学习方法
计算机视觉与模式识别
2020-12-01 v1 人工智能
摘要
不同尺寸的身体部位和物体之间的尺度变化是视觉识别任务中的一个挑战性问题。现有工作通常针对每个任务设计专门的骨干网络或应用神经架构搜索(NAS)来应对这一挑战。然而,现有工作对设计或搜索空间施加了显著限制。为解决这些问题,我们提出 ScaleNAS,一种用于探索尺度感知表征的一次性学习方法。ScaleNAS 通过搜索多尺度特征聚合一次性解决多个任务。ScaleNAS 采用灵活的搜索空间,允许任意数量的块和跨尺度特征融合。为应对灵活空间带来的高搜索成本,ScaleNAS 采用由分组采样和进化搜索驱动的多尺度超网一次性学习。无需进一步重训练,ScaleNet 可直接部署用于不同的视觉识别任务,并具有优越性能。我们使用 ScaleNAS 为两个不同的任务创建高分辨率模型:用于人体姿态估计的 ScaleNet-P 和用于语义分割的 ScaleNet-S。ScaleNet-P 和 ScaleNet-S 在两个任务中均优于现有的手工设计和基于 NAS 的方法。当将 ScaleNet-P 应用于自底向上人体姿态估计时,它超越了最先进的 HigherHRNet。特别地,ScaleNet-P4 在 COCO test-dev 上达到 71.6% AP,取得了新的最先进结果。
引用
@article{arxiv.2011.14584,
title = {ScaleNAS: One-Shot Learning of Scale-Aware Representations for Visual Recognition},
author = {Hsin-Pai Cheng and Feng Liang and Meng Li and Bowen Cheng and Feng Yan and Hai Li and Vikas Chandra and Yiran Chen},
journal= {arXiv preprint arXiv:2011.14584},
year = {2020}
}