中文

基于视觉原始素材的空间关系归纳实现领域泛化

计算机视觉与模式识别 2026-05-08 v1

摘要

领域泛化需要识别支持跨域可靠分类的稳定表征。大多数现有方法通过改进训练过程来寻求此类稳定性,例如通过模型选择策略、数据增强或特征对齐目标。虽然这些策略可能有效,但它们将结构组成的表征学习保持为隐式,可能限制在组合领域泛化基准测试上的性能。本文提出一种Primitive-Aware Relational Structure (PARSE)用于领域泛化 (PARSE),一种图像分类框架,将视觉识别分解为视觉原始素材及其关系组成。我们使用对原始素材位置的软二元、三元和四元谓词表示这些组合,生成可端到端学习的空间对齐可微度量。为联合学习原始素材和关系结构,我们设计了一个具有三个组件的端到端架构:(1)一个卷积神经网络(CNN)主干提取通用视觉特征;(2)一个概念瓶颈层将这些特征映射到带有可微空间坐标的原始素材热图;(3)一个结构评分层评估检测到的原始素材之间的候选空间关系。我们随后从其类特定关系组成的联合证据计算类别概率。在CUB-DG和DomainBed基准套件上,PARSE在CUB-DG上准确率提升超过4.5个百分点,并在DomainBed上保持与现有DG方法的竞争水平。

关键词

引用

@article{arxiv.2605.06043,
  title  = {Domain Generalization through Spatial Relation Induction over Visual Primitives},
  author = {Dat Nguyen and Duc-Duy Nguyen},
  journal= {arXiv preprint arXiv:2605.06043},
  year   = {2026}
}