CrossFlowDG:用于域自然化的跨模态流匹配
计算机视觉与模式识别
2026-04-21 v1
摘要
域自然化旨在维持域迁移后的性能,而在计算机视觉中,这主要表现为样式变化,导致模型对域特定的外观线索而非类别语义过拟合。为克服这一问题,近期方法使用文本表示作为稳定、域无关的锚点。然而,依赖于基于余弦相似性的对比式对齐的多模态方法留下了模态鸿沟,尽管存在语义对应,图像和文本嵌入仍在几何上保持分离。我们提出CrossFlowDG,一种新颖的域自然化框架,通过无噪声、跨模态流匹配来解决此剩余鸿沟。通过学习联合欧几里得潜空间中的连续变换,本框架显式地将偏向特定域的图像嵌入传输到正确类别的域无关文本嵌入。我们使用高效的VMamba图像编码器和CLIP的文本编码器,CrossFlowDG在四个常见的域自然化基准测试中进行测试,在几个基准测试中实现了竞争性能,并在TerraIncognita上实现了最先进水平。代码已公开:https://github.com/ajkrit/CrossFlowDG
引用
@article{arxiv.2604.16892,
title = {CrossFlowDG: Bridging the Modality Gap with Cross-modal Flow Matching for Domain Generalization},
author = {Antonios Kritikos and Nikolaos Spanos and Athanasios Voulodimos},
journal= {arXiv preprint arXiv:2604.16892},
year = {2026}
}
备注
Accepted in CVPRW 2026 (DG-EBF Workshop)