X-Learner:跨数据源与任务学习通用视觉表征
计算机视觉与模式识别
2022-03-17 v1 人工智能
摘要
在计算机视觉中,基于大规模监督学习的预训练模型在过去几年已被证明是有效的。然而,现有工作大多聚焦于从单一数据源的单个任务中学习(例如 ImageNet 用于分类或 COCO 用于检测)。这种受限形式由于缺少来自不同任务和数据源的丰富语义信息,限制了其泛化性与可用性。在此,我们证明联合从异构任务和多个数据源学习有助于通用视觉表征,从而带来各类下游任务更好的迁移结果。因此,学习如何弥合不同任务与数据源之间的鸿沟是关键,但这仍是一个开放问题。本工作中,我们提出一种称为 X-Learner 的表征学习框架,其通过扩展与压缩阶段学习由多源监督的多个视觉任务的通用特征:1)扩展阶段:X-Learner 通过协调层学习任务特定特征,以缓解任务干扰并丰富表征。2)压缩阶段:X-Learner 将模型压缩至合理规模,并学习用于各类任务迁移的通用且可泛化表征。大量实验表明,与现有表征学习方法相比,X-Learner 在无额外标注、模态与计算成本的情况下于不同任务上取得强劲性能。值得注意的是,单个 X-Learner 模型在12个下游分类、目标检测与语义分割数据集上分别比当前预训练模型显著提升 3.0%、3.3% 和 1.8%。
引用
@article{arxiv.2203.08764,
title = {X-Learner: Learning Cross Sources and Tasks for Universal Visual Representation},
author = {Yinan He and Gengshi Huang and Siyu Chen and Jianing Teng and Wang Kun and Zhenfei Yin and Lu Sheng and Ziwei Liu and Yu Qiao and Jing Shao},
journal= {arXiv preprint arXiv:2203.08764},
year = {2022}
}
备注
12 pages, 4 figures