基于语言引导与表征对齐的提示解耦用于领域泛化
计算机视觉与模式识别
2025-07-04 v1 机器学习
摘要
领域泛化 (DG) 旨在开发一种能够在未见目标领域上有效执行的通用模型。值得注意的是,预训练视觉基础模型 (VFMs)(如 CLIP)的最新进展在增强深度学习模型的泛化能力方面展现了巨大潜力。尽管基于 VFM 的领域提示微调在 DG 中受到越来越多的关注,但设计能够解耦跨不同领域不变特征的有效提示仍然是一个关键挑战。在本文中,我们提出利用 VFM 可控且灵活的语言提示来应对这一挑战。注意到 VFMs 的文本模态天然更容易解耦,我们引入了一个新颖的文本特征引导的视觉提示微调框架。该框架首先使用大语言模型 (LLM) 自动解耦文本提示,然后在解耦的文本特征引导下学习领域不变的视觉表征。然而,仅依赖语言来引导视觉特征解耦存在局限性,因为视觉特征有时可能过于复杂或细微,无法通过描述性文本完全捕获。为了解决这个问题,我们引入了最差显式表征对齐 (WERA),它通过引入一组额外的抽象提示来扩展文本引导的视觉提示。这些提示通过风格化图像增强来增强源领域的多样性,而对齐约束确保视觉表征在原始分布和增强分布中保持一致。在主要 DG 数据集(包括 PACS、VLCS、OfficeHome、DomainNet 和 TerraInc)上进行的实验表明,我们提出的方法优于最先进的 DG 方法。
引用
@article{arxiv.2507.02288,
title = {Prompt Disentanglement via Language Guidance and Representation Alignment for Domain Generalization},
author = {De Cheng and Zhipeng Xu and Xinyang Jiang and Dongsheng Li and Nannan Wang and Xinbo Gao},
journal= {arXiv preprint arXiv:2507.02288},
year = {2025}
}