用于鲁棒表征学习的上下文视觉Transformer
计算机视觉与模式识别
2023-10-02 v2 人工智能
计算与语言
摘要
我们提出上下文视觉Transformer(ContextViT),一种旨在为潜在因子在各组间发生偏移的数据集生成鲁棒图像表征的方法。源于上下文学习(in-context learning)的概念,ContextViT 引入额外的上下文令牌以封装组特定信息。这种整合使模型能依据组特定上下文调整图像表征。具体而言,对于给定的输入图像,ContextViT 将具有相同组归属的图像映射到此上下文令牌中,该令牌被附加到输入图像令牌之后。此外,我们引入上下文推断网络,以在给定组内一批样本时即时预测此类令牌。这使 ContextViT 能在推理时适应新的测试分布。我们展示了 ContextViT 在广泛应用中的有效性。在有监督微调中,我们表明用所提上下文调节机制增强预训练 ViT,可在 iWildCam 和 FMoW 的分布外泛化上带来一致提升。我们也研究了 ContextViT 的自监督表征学习。在 Camelyon17 病理成像基准和 JUMP-CP 显微镜成像基准上的实验表明,ContextViT 在分布偏移中擅长学习稳定图像特征化,持续优于其 ViT 对应模型。
引用
@article{arxiv.2305.19402,
title = {Contextual Vision Transformers for Robust Representation Learning},
author = {Yujia Bao and Theofanis Karaletsos},
journal= {arXiv preprint arXiv:2305.19402},
year = {2023}
}