中文

视觉预训练是否有助于端到端推理?

计算机视觉与模式识别 2023-12-19 v2 人工智能 机器学习

摘要

我们旨在研究借助视觉预训练,是否能通过通用神经网络实现视觉推理的端到端学习。若得到肯定结果,将反驳“显式视觉抽象(如目标检测)对视觉推理的组合泛化至关重要”的普遍看法,并证实神经网络“通才”解决视觉识别与推理任务的可行性。我们提出一个简单通用的自监督框架,用Transformer网络将每视频帧“压缩”为少量token,并基于压缩的时间上下文重建其余帧。为最小化重建损失,网络必须学习每幅图像的紧凑表示,并从时间上下文中捕捉时间动态与物体恒存性。我们在两个视觉推理基准CATER和ACRE上评估。我们观察到预训练对实现端到端视觉推理的组合泛化至关重要。我们提出的框架大幅优于传统监督预训练,包括图像分类与显式目标检测。

关键词

引用

@article{arxiv.2307.08506,
  title  = {Does Visual Pretraining Help End-to-End Reasoning?},
  author = {Chen Sun and Calvin Luo and Xingyi Zhou and Anurag Arnab and Cordelia Schmid},
  journal= {arXiv preprint arXiv:2307.08506},
  year   = {2023}
}

备注

NeurIPS 2023