中文

基础模型面临的低资源视觉挑战

计算机视觉与模式识别 2024-04-12 v3

摘要

低资源设置在自然语言处理中已得到充分确立,许多语言缺乏足够的数据来进行大规模的深度学习。然而,低资源问题在计算机视觉中尚未得到充分探索。在本文中,我们填补了这一空白,并探讨了使用视觉基础模型处理低资源图像任务的挑战。我们首先收集了一个真正的低资源图像数据基准,涵盖历史地图、电路图和机械图纸。这些低资源设置都具有三个共同挑战:数据稀缺、细粒度差异以及从自然图像到特定专业领域的分布偏移。尽管现有的基础模型已展现出令人印象深刻的泛化能力,但我们发现它们无法很好地迁移到我们的低资源任务中。为了着手解决低资源视觉的挑战,我们针对每个挑战引入了一个简单的基线方法。具体来说,我们 i) 通过生成模型扩大数据空间,ii) 采用最佳子核对局部区域进行编码以发现细粒度差异,以及 iii) 学习针对特定领域的注意力机制。在我们三个低资源任务上的实验表明,我们的提议已经提供了比迁移学习、数据增强和细粒度方法更好的基线。这凸显了低资源视觉对基础模型而言的独特特征和挑战,值得进一步研究。项目页面:https://xiaobai1217.github.io/Low-Resource-Vision/。

关键词

引用

@article{arxiv.2401.04716,
  title  = {Low-Resource Vision Challenges for Foundation Models},
  author = {Yunhua Zhang and Hazel Doughty and Cees G. M. Snoek},
  journal= {arXiv preprint arXiv:2401.04716},
  year   = {2024}
}

备注

Accepted at CVPR2024