通过可离散点学习统一视觉感知
计算机视觉与模式识别
2022-09-13 v2
摘要
我们提出了一种概念简单、灵活且通用的视觉感知头,适用于多种视觉任务(如分类、目标检测、实例分割与姿态估计)以及不同框架(如单阶段或两阶段流程)。我们的方法能有效识别图像中的物体,同时生成高质量的边界框或基于轮廓的分割掩码或关键点集合。该方法称为UniHead,将通过transformer编码器架构的不同视觉感知任务视为可离散点学习。给定固定空间坐标,UniHead自适应地将其散射到不同空间点,并通过transformer编码器推理它们的关系。它直接以多点形式输出最终预测集合,使我们能以相同头部设计在不同框架中执行不同视觉任务。我们在ImageNet分类及COCO挑战套件的所有三个赛道(包括目标检测、实例分割与姿态估计)上展示了广泛评估。无需额外技巧,UniHead可通过单一视觉头部设计统一这些视觉任务,并取得与为每个任务开发的专家模型相当的性能。我们希望这种简单且通用的UniHead能作为坚实基线,并助力通用视觉感知研究。代码与模型见 https://github.com/Sense-X/UniHead。
引用
@article{arxiv.2208.08630,
title = {Unifying Visual Perception by Dispersible Points Learning},
author = {Jianming Liang and Guanglu Song and Biao Leng and Yu Liu},
journal= {arXiv preprint arXiv:2208.08630},
year = {2022}
}
备注
Accepted by ECCV 2022. Code: https://github.com/Sense-X/UniHead