中文

FindIt:基于自然语言查询的通用定位框架

计算机视觉与模式识别 2022-08-10 v2

摘要

我们提出 FindIt,一个简单且通用的框架,统一了多种视觉定位与 localization 任务,包括指代表达理解、基于文本的定位和物体检测。我们架构的关键在于一个高效的多尺度融合模块,该模块统一了各任务间不同的定位需求。此外,我们发现一个标准物体检测器在统一这些任务时出奇地有效,无需针对任务的设计、损失或预计算检测结果。我们端到端可训练的框架能够灵活且准确地响应针对零个、一个或多个物体的广泛指代表达、定位或检测查询。在这些任务上联合训练后,FindIt 在指代表达和基于文本的 localization 上均优于最先进水平,并在物体检测上展现出有竞争力的性能。最后,与强大的单任务基线相比,FindIt 对分布外数据和新型类别具有更好的泛化能力。所有这些均由一个单一、统一且高效的模型实现。代码将被发布。

关键词

引用

@article{arxiv.2203.17273,
  title  = {FindIt: Generalized Localization with Natural Language Queries},
  author = {Weicheng Kuo and Fred Bertsch and Wei Li and AJ Piergiovanni and Mohammad Saffar and Anelia Angelova},
  journal= {arXiv preprint arXiv:2203.17273},
  year   = {2022}
}

备注

Accepted to ECCV 2022 (European Conference on Computer Vision)