中文

无图像学习场景上下文

计算机视觉与模式识别 2023-11-21 v1

摘要

向机器传授场景上下文知识,可使它们更有效地与环境交互,并预测或预判在其感知领域中未必立即可见的物体。本文提出一种名为 LMODLMOD(基于标签的缺失物体检测)的、基于 transformer 的新方法,利用注意力机制向机器传授场景上下文知识。所提方法的一个显著特点是仅依赖图像数据集的标签来传授场景上下文,完全无需实际图像本身。我们展示了如何利用自注意力机制学习不同物体间的全局关系。我们进一步表明,从基于标签的学习中获得的上下文知识可提升其他基于视觉的物体检测算法的性能。

关键词

引用

@article{arxiv.2311.10998,
  title  = {Learning Scene Context Without Images},
  author = {Amirreza Rouhi and David Han},
  journal= {arXiv preprint arXiv:2311.10998},
  year   = {2023}
}