中文

TextInPlace:基于场景文本检测与验证的重复结构室内视觉位置识别

计算机视觉与模式识别 2025-08-12 v2 机器人学

摘要

视觉位置识别 (VPR) 是长期自主机器人的一项关键能力,使其能够利用视觉信息识别先前访问过的位置。然而,由于此类环境中固有的高度重复结构,现有方法在室内环境中的表现仍然受限。我们观察到场景文本在室内空间中频繁出现,可以帮助区分视觉上相似但实际不同的地点。这启发我们提出 TextInPlace,一种简单而有效的 VPR 框架,该框架集成了场景文本检测 (STS) 以减轻重复室内环境中的视觉感知模糊性。具体而言,TextInPlace 在局部参数共享网络中采用双分支架构。VPR 分支采用基于注意力的聚合来提取全局描述符以进行粗粒度检索,而 STS 分支利用桥接文本检测器来检测和识别场景文本。最后,过滤出具有区分性的文本以计算文本相似度,并对检索出的 Top-K 图像进行重排序。为了弥合当前基于文本的重复室内场景数据集与机器人导航中遇到的典型场景之间的差距,我们建立了一个名为 Maze-with-Text 的室内 VPR 基准数据集。在自定义和公开数据集上的大量实验表明,TextInPlace 优于仅依赖外观信息的现有方法。数据集、代码和训练好的模型已在 https://github.com/HqiTao/TextInPlace 公开。

关键词

引用

@article{arxiv.2503.06501,
  title  = {TextInPlace: Indoor Visual Place Recognition in Repetitive Structures with Scene Text Spotting and Verification},
  author = {Huaqi Tao and Bingxi Liu and Calvin Chen and Tingjun Huang and He Li and Jinqiang Cui and Hong Zhang},
  journal= {arXiv preprint arXiv:2503.06501},
  year   = {2025}
}

备注

Accepted to IROS 2025