中文

利用视觉 Transformer 增强杂乱真实场景中的地标检测

计算机视觉与模式识别 2023-08-29 v1

摘要

视觉地点识别任务常因人类、车辆、树木等无关物体的存在而在地标检测上遭遇重大挑战,尽管先前模型——尤其在 transformer 背景下——已取得显著进展。为解决此问题,我们提出一种新方法,有效发挥视觉 Transformer 的优势。通过精细的选择过程,我们的方法识别并隔离图像中对应于遮挡物体的特定块。为评估方法有效性,我们创建了增强数据集并进行了全面测试。结果表明所提方法达到了更优的精度。本研究推动了视觉地点识别中地标检测的发展,并展示了利用视觉 Transformer 克服杂乱真实场景所带来挑战的潜力。

关键词

引用

@article{arxiv.2308.13671,
  title  = {Enhancing Landmark Detection in Cluttered Real-World Scenarios with Vision Transformers},
  author = {Mohammad Javad Rajabi and Morteza Mirzai and Ahmad Nickabadi},
  journal= {arXiv preprint arXiv:2308.13671},
  year   = {2023}
}