CoDoL: 条件域提示学习用于越域泛化
摘要
近期预训练视觉语言模型 (VLM),例如对比语言-图像预训练 (CLIP) 方法,在学习 out-of-distribution (OOD) representations 方面显示出巨大的潜力。尽管展示出 competitive performance,但基于提示的 CLIP 方法仍面临:i) 不准确的 text descriptions 导致 accuracy 和 robustness 下降,给 zero-shot CLIP 方法构成挑战;ii) limited vision-language embedding alignment 大幅影响 generalization performance。为解决上述问题,本文提出一种 novel Conditional Domain prompt Learning (CoDoL) 方法,利用 readily-available domain information form prompts 并 improve vision-language embedding alignment 以提升 OOD generalization。为捕获 instance-specific 和 domain-specific 信息,我们进一步提出一种 lightweight Domain Meta Network (DMN) 来为 each domain 中的 images 生成 input-conditional tokens。在四个 OOD benchmark (PACS, VLCS, OfficeHome 和 DigitDG) 上进行 extensive 实验验证了我们 proposed CoDoL 在 improve vision-language embedding alignment 以及 out-of-distribution generalization performance 方面的有效性。
引用
@article{arxiv.2509.15330,
title = {CoDoL: Conditional Domain Prompt Learning for Out-of-Distribution Generalization},
author = {Min Zhang and Bo Jiang and Jie Zhou and Yimeng Liu and Xin Lin},
journal= {arXiv preprint arXiv:2509.15330},
year = {2025}
}