适应分布偏移的大型多模态模型:上下文学习的作用
计算机视觉与模式识别
2024-10-16 v2 人工智能
机器学习
摘要
最近的研究表明,大型多模态模型(LMMs)有潜力作为通用助手,并且对不同的分布具有高度的鲁棒性。尽管如此,特定领域的适应仍然是必要的,特别是在医疗保健等专业领域。鉴于 LMMs 庞大的参数空间使得微调不切实际,本研究探讨了上下文学习(ICL)作为增强 LMMs 适应性的有效替代方案。我们的研究通过评估一种无监督 ICL 方法来解决这一问题,该方法通过基于特征相似性的最近样本搜索来选择上下文示例。我们发现,其有效性受到预训练视觉编码器在分布偏移场景下缺陷的限制。为了应对这些挑战,我们提出了 InvariantSelectPR,这是一种利用类别条件对比不变性(CCI)进行更鲁棒示例选择的新方法。具体而言,CCI 通过提高编码器在不同类别间的判别能力并确保对特定领域变化的不变性,来增强预训练视觉编码器。这种增强使编码器能够有效地识别和检索信息量最大的示例,随后用于引导 LMMs 适应不同分布下的新查询样本。我们的实验表明,InvariantSelectPR 显著提高了 LMMs 的适应性,在基准数据集上取得了显著的性能提升,与基线零样本性能相比,在 Camelyon17 上的 7-shot 准确率提高了 34.2%,在 HAM10000 上的 7-shot 准确率提高了 16.9%。
引用
@article{arxiv.2405.12217,
title = {Adapting Large Multimodal Models to Distribution Shifts: The Role of In-Context Learning},
author = {Guanglin Zhou and Zhongyi Han and Shiming Chen and Biwei Huang and Liming Zhu and Salman Khan and Xin Gao and Lina Yao},
journal= {arXiv preprint arXiv:2405.12217},
year = {2024}
}
备注
10 pages, 9 figures, 7 tables