中文

观察、学习与利用(L$^3$):通过符号对齐缓解视觉域偏移并发现内在关系

计算机视觉与模式识别 2024-09-02 v1

摘要

当视觉外观和内在关系(如因果结构)数据充足时,现代深度学习模型在发现潜在机制方面表现出色,例如解耦表示学习(DRL)、因果表示学习(CRL)和视觉问答(VQA)方法。然而,当视觉域发生偏移且微调期间缺少关系数据时,这些模型的泛化能力受到挑战。为了应对这一挑战,我们提出了一种新颖的学习框架,观察、学习与利用(L3^3),该框架将学习过程分解为三个不同阶段,并系统地利用与类别无关的分割掩码作为公共符号空间来对齐视觉域。因此,关系发现模型可以在源域上训练,当视觉域发生偏移且缺少内在关系时,预训练的关系发现模型可以直接重用并保持令人满意的性能。我们在三个不同任务:DRL、CRL 和 VQA 上进行了广泛的性能评估,并在所有三个任务上显示出优异的结果,这揭示了 L3^3 的优势。

关键词

引用

@article{arxiv.2408.17363,
  title  = {Look, Learn and Leverage (L$^3$): Mitigating Visual-Domain Shift and Discovering Intrinsic Relations via Symbolic Alignment},
  author = {Hanchen Xie and Jiageng Zhu and Mahyar Khayatkhoei and Jiazhi Li and Wael AbdAlmageed},
  journal= {arXiv preprint arXiv:2408.17363},
  year   = {2024}
}

备注

17 pages, 9 figures, 6 tables