中文

促进科学中的 AI 公平:面向无障碍 VLM 研究的泛化领域提示学习

计算机视觉与模式识别 2024-05-15 v1 人工智能 机器学习 应用统计

摘要

大规模视觉语言模型(Vision-Language Models, VLMs)在自然视觉任务中展现出了卓越的性能,促使各领域的研究者探索领域特定的 VLM。然而,构建强大的领域特定 VLM 需要海量的标注数据、大量的电力和计算资源,这些资源主要掌握在工业界手中,从而阻碍了学术界的 VLM 研究。为了应对这一挑战并促进可持续且公平的 VLM 研究,我们提出了泛化领域提示学习(Generalized Domain Prompt Learning, GDPL)框架。GDPL 促进了 VLM 强大的识别能力从自然视觉向特定领域的迁移,而无需大量数据或资源。通过利用小规模领域特定基础模型和极少的提示样本,GDPL 借助四元数网络将领域知识赋予语言分支,揭示了领域特定视觉特征与基于自然视觉的上下文嵌入之间的跨模态关系。同时,GDPL 通过基于匹配良好的视觉-语言关系的生成视觉提示特征的分层传播,引导视觉分支进入特定领域。此外,为了充分挖掘 VLM 的领域适应潜力,我们引入了一种新颖的低秩适应方法。在遥感、医学成像、地质、合成孔径雷达和流体力学等多个领域的广泛实验验证了 GDPL 的有效性,证明了其能够在提示学习范式中实现 SOTA 的领域识别性能。我们的框架为可持续和包容性的 VLM 研究铺平了道路,跨越了学术界与工业界之间的壁垒。

关键词

引用

@article{arxiv.2405.08668,
  title  = {Promoting AI Equity in Science: Generalized Domain Prompt Learning for Accessible VLM Research},
  author = {Qinglong Cao and Yuntian Chen and Lu Lu and Hao Sun and Zhenzhong Zeng and Xiaokang Yang and Dongxiao Zhang},
  journal= {arXiv preprint arXiv:2405.08668},
  year   = {2024}
}