中文

SRRM:用于室内场景识别的语义区域关系模型

计算机视觉与模式识别 2024-08-09 v1

摘要

尽管卷积神经网络在各种计算机视觉任务中取得了显著成功,但由于室内场景组成复杂,识别室内场景仍是一项重大挑战。因此,有效利用场景中的语义信息一直是推进室内场景识别的关键问题。遗憾的是,语义分割的精度限制了现有利用语义信息方法的有效性。结果,许多此类方法仍停留在辅助标注或共现统计阶段,极少直接探索场景内语义元素之间的上下文关系。本文中,我们提出语义区域关系模型(SRRM),它直接从场景内部的语义信息出发。具体而言,SRRM 采用自适应且高效的方法减轻语义歧义的负面影响,然后建模语义区域关系以执行场景识别。此外,为更全面地利用场景所含信息,我们将提出的 SRRM 与 PlacesCNN 模块结合创建组合语义区域关系模型(CSRRM),并提出一种新颖的信息结合方法以有效探索二者间的互补内容。CSRRM 在 MIT Indoor 67、精简 Places365 数据集和 SUN RGB-D 上无需重训练即显著优于 SOTA 方法。代码见:https://github.com/ChuanxinSong/SRRM

关键词

引用

@article{arxiv.2305.08540,
  title  = {SRRM: Semantic Region Relation Model for Indoor Scene Recognition},
  author = {Chuanxin Song and Xin Ma},
  journal= {arXiv preprint arXiv:2305.08540},
  year   = {2024}
}

备注

8 pages, 7 figures, published to IJCNN 2023. The code is available at: https://github.com/ChuanxinSong/SRRM