中文

少样本视觉关系共定位

计算机视觉与模式识别 2021-08-27 v1 人工智能

摘要

在本文中,给定一小袋图像,每张图像包含一个共同但潜在的谓词,我们有兴趣在每张图像中定位通过该共同谓词连接的视觉主客体对。我们将这一新颖问题称为视觉关系共定位,或简称为 VRC。VRC 是一项具有挑战性的任务,甚至比研究充分的物体共定位任务更具挑战性。当仅使用少量图像时,模型必须学会共定位由未见谓词连接的视觉主客体对,这使其更具挑战性。为了解决 VRC,我们提出了一个优化框架,用于在每袋图像中选择一个共同的视觉关系。该优化框架的目标是通过在少样本设置下学习跨图像的视觉关系相似性来寻找最优解。为了获得鲁棒的视觉关系表示,我们采用了一种简单而有效的技术,将关系嵌入学习为共享空间中从视觉主体到视觉客体的平移向量。此外,为了学习视觉关系相似性,我们利用了一种在少样本分类任务中常用的成熟元学习技术。最后,为了应对由指数级数量的可行解引起的组合复杂性挑战,我们使用了一种贪心近似推理算法来选择近似最优解。我们在从两个具有挑战性的公开数据集(即 VrR-VG 和 VG-150)获取的不同袋大小的变体上广泛评估了我们提出的框架,并取得了令人印象深刻的视觉共定位性能。

关键词

引用

@article{arxiv.2108.11618,
  title  = {Few-shot Visual Relationship Co-localization},
  author = {Revant Teotia and Vaibhav Mishra and Mayank Maheshwari and Anand Mishra},
  journal= {arXiv preprint arXiv:2108.11618},
  year   = {2021}
}

备注

Accepted in ICCV 2021