中文

SLAN:用于跨模态理解的自定位辅助网络

计算机视觉与模式识别 2022-12-09 v2

摘要

学习视觉与语言之间细粒度的相互作用可实现对视觉语言任务更精确的理解。然而,根据文本提取关键图像区域以进行语义对齐仍然具有挑战性。现有多数工作要么受限于使用冻结检测器获得的与文本无关且冗余的区域,要么因其严重依赖稀缺的接地(gold)数据预训练检测器而难以进一步扩展。为解决这些问题,我们提出自定位辅助网络(SLAN),用于无需任何额外 gold 数据的跨模态理解任务。SLAN 由区域过滤器和区域适配器组成,以根据不同文本定位感兴趣区域。通过聚合跨模态信息,区域过滤器筛选关键区域,区域适配器在文本引导下更新其坐标。借助细致的区域-词对齐,SLAN 可轻松泛化至许多下游任务。其在五项跨模态理解任务上取得了极具竞争力的结果(例如,在 COCO 图搜文和文搜图检索上分别达到 85.7% 和 69.2%,超越先前 SOTA 方法)。SLAN 还对两项定位任务展现出强大的零样本与微调迁移能力。

关键词

引用

@article{arxiv.2211.16208,
  title  = {SLAN: Self-Locator Aided Network for Cross-Modal Understanding},
  author = {Jiang-Tian Zhai and Qi Zhang and Tong Wu and Xing-Yu Chen and Jiang-Jiang Liu and Bo Ren and Ming-Ming Cheng},
  journal= {arXiv preprint arXiv:2211.16208},
  year   = {2022}
}

备注

12 pages