中文

基于聚类的图像-文本图匹配用于域泛化

计算机视觉与模式识别 2024-12-25 v3 人工智能

摘要

学习域不变视觉表征对于训练能良好泛化至未知目标任务域的模型十分重要。近期工作表明,文本描述包含高层类判别信息,此类辅助语义线索可用作域泛化问题的有效枢纽嵌入。然而,它们以全局方式使用枢纽嵌入(即将图像嵌入与句子级文本嵌入对齐),未能充分利用给定文本描述的语义线索。本工作主张在图像区域与对应文本描述间使用局部对齐以获取域不变特征。为此,我们首先将图像与文本输入表示为图。随后对这些图内的节点聚类,并将基于图的影像节点特征与文本图的节点匹配。该匹配过程在全局与局部同时进行,紧密对齐视觉与文本语义子结构。我们在 CUB-DG 与 DomainBed 等大规模公开数据集上实验,模型在这些数据集上取得相当或优于当前最优的性能。代码见:https://github.com/noparkee/Graph-Clustering-based-DG

关键词

引用

@article{arxiv.2310.02692,
  title  = {Clustering-based Image-Text Graph Matching for Domain Generalization},
  author = {Nokyung Park and Daewon Chae and Jeongyong Shim and Sangpil Kim and Eun-Sol Kim and Jinkyu Kim},
  journal= {arXiv preprint arXiv:2310.02692},
  year   = {2024}
}