中文

多模态查询引导的目标定位

计算机视觉与模式识别 2024-07-25 v2

摘要

考虑一次性查询引导目标定位场景,其中既无目标图像也无目标类别名称可作为查询。此情形下,目标的手绘草图可作为查询选择。然而,仅以手绘粗略草图作为查询,用于目标定位时可能含混,例如笔记本电脑草图易被误认为沙发。另一方面,类别的语言定义(如“小到可置于膝上使用的便携式计算机”)连同草图查询,可提供更好的视觉与语义线索用于目标定位。本文提出一种挑战性开集设定下的多模态查询引导目标定位方法。具体而言,我们使用来自两种模态的查询,即手绘草图与目标描述(亦称 gloss),来执行目标定位。多模态查询引导目标定位是一项挑战性任务,尤其当查询与自然图像间存在较大域差距,且因需融合跨查询的互补与极少信息而困难。例如,手绘粗略草图含目标抽象形状信息,而文本描述常捕获给定目标类别的部分语义信息。为应对上述挑战,我们提出一种新颖跨模态注意力机制,引导区域提议网络生成与输入查询相关的目标提议,以及一种基于正交投影的提议打分技术,依据查询对每个提议打分,从而得到最终定位结果。

关键词

引用

@article{arxiv.2212.00749,
  title  = {Multimodal Query-guided Object Localization},
  author = {Aditay Tripathi and Rajath R Dani and Anand Mishra and Anirban Chakraborty},
  journal= {arXiv preprint arXiv:2212.00749},
  year   = {2024}
}

备注

Accepted to MMTA