ED-SAM:一种面向视觉语言基础模型域泛化的高效扩散采样方法
计算机视觉与模式识别
2024-06-04 v1
摘要
视觉语言基础模型最近在各种感知学习任务中展现出卓越的性能。视觉语言模型出色的性能主要依赖于大规模预训练数据集和不同的数据增强技术。然而,视觉语言基础模型的域泛化问题需要解决。该问题限制了视觉语言基础模型对未知数据分布的泛化能力。在本文中,我们引入了一种新的简单但高效的扩散采样方法用于域泛化(ED-SAM),以提高视觉语言基础模型的泛化能力。本文的理论分析揭示了扩散模型在视觉语言基础模型域泛化中的关键作用及其关系。然后,基于深入的分析,我们引入了一种新的简单而有效的传输变换到扩散采样方法。它可以有效地生成对抗样本,以提高基础模型对未知数据分布的泛化能力。在不同规模的视觉语言预训练数据集(包括 CC3M、CC12M 和 LAION400M)上的实验结果一致表明,与其他近期方法相比,所提出的 ED-SAM 方法具有最先进的(State-of-the-Art)性能和可扩展性。
引用
@article{arxiv.2406.01432,
title = {ED-SAM: An Efficient Diffusion Sampling Approach to Domain Generalization in Vision-Language Foundation Models},
author = {Thanh-Dat Truong and Xin Li and Bhiksha Raj and Jackson Cothren and Khoa Luu},
journal= {arXiv preprint arXiv:2406.01432},
year = {2024}
}