机器视觉治疗:多模态大语言模型通过去噪上下文学习增强视觉鲁棒性
计算机视觉与模式识别
2024-05-30 v2
摘要
尽管对比语言-图像预训练等视觉模型表现出令人印象深刻的泛化性能,但在没有微调的情况下,它们在分布外场景下的零样本鲁棒性仍然有限。与通常不理想地提供人工监督不同,可以利用具有强大视觉理解能力的多模态大语言模型。然而,由于任务的不兼容性,多模态大语言模型在处理视觉问题方面存在困难,从而阻碍了它们的利用。在本文中,我们提出有效利用多模态大语言模型进行机器视觉治疗,旨在纠正视觉模型的噪声预测。通过使用去噪标签进行微调,学习模型的性能可以在无监督的方式下得到提升。为了解决不兼容问题,我们提出了一种新颖的去噪上下文学习策略,将视觉任务与多模态大语言模型对齐。具体来说,通过估计一个捕捉一个类别与另一个类别混淆概率的转移矩阵,可以构建一个包含正确示例和来自最可能噪声类别的错误示例的指令。这样的指令可以帮助任何具有上下文学习能力的多模态大语言模型检测和纠正视觉模型的错误预测。通过在ImageNet、WILDS、DomainBed和其他分布外数据集上的大量实验,我们仔细验证了我们方法的定量和定性有效性。我们的代码可在https://github.com/tmllab/Machine_Vision_Therapy获取。
引用
@article{arxiv.2312.02546,
title = {Machine Vision Therapy: Multimodal Large Language Models Can Enhance Visual Robustness via Denoising In-Context Learning},
author = {Zhuo Huang and Chang Liu and Yinpeng Dong and Hang Su and Shibao Zheng and Tongliang Liu},
journal= {arXiv preprint arXiv:2312.02546},
year = {2024}
}
备注
ICML 2024