中文

RefCrowd:利用指代表达式在人群中定位目标人物

计算机视觉与模式识别 2022-06-17 v1

摘要

人群理解因其重要的实际意义而在视觉领域引起了广泛关注。遗憾的是,目前尚无研究在多模态领域(连接自然语言与计算机视觉)中探索人群理解。指代表达式理解(REF)正是这样一项具有代表性的多模态任务。现有 REF 研究更多关注在通用场景中将目标对象从多个不同类别中定位出来,难以应用于复杂的真实世界人群理解。为填补这一空白,我们提出了一个名为 RefCrowd 的新且具有挑战性的数据集,旨在利用指代表达式在人群中寻找目标人物。它不仅需要充分挖掘自然语言信息,还需要仔细关注目标与一群外观相似人物之间的细微差异,从而实现从语言到视觉的细粒度映射。此外,我们提出了一种细粒度多模态属性对比网络(FMAC)来处理人群理解中的 REF。该网络首先将复杂的视觉与语言特征分解为属性感知的多模态特征,然后捕捉具有判别性且鲁棒性的细粒度属性特征,以有效区分相似人物之间的这些细微差异。所提方法在我们的 RefCrowd 数据集和现有 REF 数据集上均优于当前最先进(SoTA)方法。此外,我们实现了一个端到端 REF 工具箱,以促进多模态领域的深入研究。我们的数据集与代码可在:\url{https://qiuheqian.github.io/datasets/refcrowd/} 获取。

关键词

引用

@article{arxiv.2206.08172,
  title  = {RefCrowd: Grounding the Target in Crowd with Referring Expressions},
  author = {Heqian Qiu and Hongliang Li and Taijin Zhao and Lanxiao Wang and Qingbo Wu and Fanman Meng},
  journal= {arXiv preprint arXiv:2206.08172},
  year   = {2022}
}