利用视觉Transformer学习显式以对象为中心的表示
计算机视觉与模式识别
2022-10-26 v1 机器学习
摘要
随着近期transformers向视觉领域的成功适配,尤其在自监督训练方式下,研究表明视觉transformers能够学习到令人印象深刻的类对象推理行为,以及对于图像中对象分割任务具有表现力的特征。本文基于掩码自编码的自监督任务,探索其利用transformers显式学习以对象为中心表示的有效性。为此,我们设计了一个仅使用transformers的对象中心自编码器,并端到端训练它以从未掩码图像块重建完整图像。我们表明,该模型能高效学习分解简单场景,这通过多个多对象基准上的分割指标得以衡量。
引用
@article{arxiv.2210.14139,
title = {Learning Explicit Object-Centric Representations with Vision Transformers},
author = {Oscar Vikström and Alexander Ilin},
journal= {arXiv preprint arXiv:2210.14139},
year = {2022}
}