中文

基于单源域生成的领域无关表示——WIDIn

计算机视觉与模式识别 2024-05-29 v1 人工智能

摘要

语言在扩展视觉编码器以适应各种分布的数据方面一直发挥着重要作用,而无需在训练域中进行经验性发现。然而,由于图像描述大多在粗粒度层次上进行且忽略视觉细节,生成的嵌入仍然无效于克服推理时域的复杂性。我们提出了自监督框架 WIDIn,即 Wording Images for Domain-Invariant representation,以单一域数据为基础,无需任何 test prior 来解�od 判别性视觉表示。具体而言,对于每张图像,我们首先估计具有细粒度对齐的语言嵌入,随后用于自适应识别并移除原始视觉嵌入中的 domain-specific 对应部分。WIDIn 可应用于像 CLIP 这类预训练视觉语言模型,也可应用于如 MoCo 和 BERT 这类单模态模型。实验在三个 domain generalization 数据集上表明,我们的方法有效。

关键词

引用

@article{arxiv.2405.18405,
  title  = {WIDIn: Wording Image for Domain-Invariant Representation in Single-Source Domain Generalization},
  author = {Jiawei Ma and Yulei Niu and Shiyuan Huang and Guangxing Han and Shih-Fu Chang},
  journal= {arXiv preprint arXiv:2405.18405},
  year   = {2024}
}