中文

Omniview-Tuning:提升视觉-语言预训练模型的视角不变性

计算机视觉与模式识别 2024-04-19 v1

摘要

像CLIP这样的视觉-语言预训练(VLP)模型在计算机视觉中取得了显著成功,特别是在对2D图像分布偏移的鲁棒性方面表现出色。然而,它们在3D视角变化下的鲁棒性仍然有限,这可能阻碍其在现实世界中的应用。本文通过突破两个主要障碍成功解决了这一问题,同时保持了VLP的原始性能:1)训练数据的稀缺性,2)次优的微调范式。为了解决数据稀缺问题,我们构建了多视角描述(MVCap)数据集——一个包含超过10万个对象的四百多万个多视角图像-文本对的全面集合,为VLP模型开发可泛化的视角不变表示提供了更多潜力。为了解决现有范式在性能权衡和训练效率方面的局限性,我们设计了一个名为Omniview-Tuning(OVT)的新型微调框架。具体来说,OVT通过一种类似极小极大的优化策略引入了跨视角对齐目标,有效地对齐了来自不同视角的相同对象的表示,而不会导致过拟合。此外,OVT以参数高效的方式微调VLP模型,从而将计算成本降至最低。在各种不同架构的VLP模型上的大量实验验证了OVT显著提高了模型对视角变化的鲁棒性,并保持了原始性能,为提升VLP模型的视角不变性建立了开创性标准。

关键词

引用

@article{arxiv.2404.12139,
  title  = {Omniview-Tuning: Boosting Viewpoint Invariance of Vision-Language Pre-training Models},
  author = {Shouwei Ruan and Yinpeng Dong and Hanqing Liu and Yao Huang and Hang Su and Xingxing Wei},
  journal= {arXiv preprint arXiv:2404.12139},
  year   = {2024}
}

备注

20 pages