中文

克服视觉-语言模型微调在分布外泛化中的陷阱

计算机视觉与模式识别 2024-04-17 v2 人工智能

摘要

现有的视觉-语言模型在各种视觉领域和任务上表现出强大的泛化能力。然而,此类模型主要以闭集方式进行零样本识别,因此在设计上难以处理开放域视觉概念。最近的一些微调方法,如提示学习,不仅研究了分布内(ID)和分布外(OOD)样本之间的区分,而且在 ID 和 OOD 准确率方面均显示出一些改进。在本文中,我们首先证明视觉-语言模型在经过足够长时间的微调但缺乏适当正则化时,往往会过拟合给定数据集中的已知类别,导致在未知类别上的性能下降。然后我们提出了一种新方法 OGEN 来解决这一陷阱,主要侧重于提高微调模型的 OOD 泛化能力。具体而言,引入了一个类条件特征生成器,仅使用任何未知类的类名来合成 OOD 特征。这些合成特征将提供关于未知类的有用知识,并在联合优化时帮助正则化 ID 和 OOD 数据之间的决策边界。同样重要的是我们的自适应自蒸馏机制,用于在联合优化期间正则化我们的特征生成模型,即在模型状态之间自适应地转移知识以进一步防止过拟合。实验验证了我们的方法在不同设置下的 OOD 泛化性能中产生了令人信服的增益。代码:https://github.com/apple/ml-ogen。

关键词

引用

@article{arxiv.2401.15914,
  title  = {Overcoming the Pitfalls of Vision-Language Model Finetuning for OOD Generalization},
  author = {Yuhang Zang and Hanlin Goh and Josh Susskind and Chen Huang},
  journal= {arXiv preprint arXiv:2401.15914},
  year   = {2024}
}

备注

ICLR 2024