中文

INDIGO:面向域泛化的内在多模态方法

计算机视觉与模式识别 2022-06-14 v1

摘要

对于在未知域下泛化(即域泛化)的模型而言,学习域无关且捕捉构成对象类别的底层语义的特征表示至关重要。近期朝向弱监督视觉-语言模型的进展表明,从廉价的弱监督噪声文本标注中学习整体表示的模型,能够通过捕捉在不同域下泛化的对象特征来展现其语义理解能力。然而,当涉及多个源域时,为数据集中每幅图像整理文本标注的成本会随源域数量成倍增长。这使得过程繁琐且不可行,阻碍我们直接运用这些有监督视觉-语言方法在未知域上取得最佳泛化。受此启发,我们研究如何以“内在”方式利用现有预训练多模态网络中的多模态信息,使系统在未知域下泛化。为此,我们提出 IntriNsic multimodality for DomaIn GeneralizatiOn (INDIGO),一种简单而优雅的方法,利用这些预训练多模态网络中固有的模态与视觉模态,在测试时增强对未知域的泛化能力。我们在多种域泛化设定(ClosedDG、OpenDG 和有限源)上实验,并展现出对未知域的 SOTA 泛化性能。此外,我们提供详尽分析以建立对 INDIGO 的整体理解。

关键词

引用

@article{arxiv.2206.05912,
  title  = {INDIGO: Intrinsic Multimodality for Domain Generalization},
  author = {Puneet Mangla and Shivam Chandhok and Milan Aggarwal and Vineeth N Balasubramanian and Balaji Krishnamurthy},
  journal= {arXiv preprint arXiv:2206.05912},
  year   = {2022}
}

备注

Under Submission