视觉预训练是否有助于端到端推理?
计算机视觉与模式识别
2023-12-19 v2 人工智能
机器学习
摘要
我们旨在研究借助视觉预训练,是否能通过通用神经网络实现视觉推理的端到端学习。若得到肯定结果,将反驳“显式视觉抽象(如目标检测)对视觉推理的组合泛化至关重要”的普遍看法,并证实神经网络“通才”解决视觉识别与推理任务的可行性。我们提出一个简单通用的自监督框架,用Transformer网络将每视频帧“压缩”为少量token,并基于压缩的时间上下文重建其余帧。为最小化重建损失,网络必须学习每幅图像的紧凑表示,并从时间上下文中捕捉时间动态与物体恒存性。我们在两个视觉推理基准CATER和ACRE上评估。我们观察到预训练对实现端到端视觉推理的组合泛化至关重要。我们提出的框架大幅优于传统监督预训练,包括图像分类与显式目标检测。
引用
@article{arxiv.2307.08506,
title = {Does Visual Pretraining Help End-to-End Reasoning?},
author = {Chen Sun and Calvin Luo and Xingyi Zhou and Anurag Arnab and Cordelia Schmid},
journal= {arXiv preprint arXiv:2307.08506},
year = {2023}
}
备注
NeurIPS 2023