TSM-Pose:基于语义 Mamba 的拓扑感知学习用于类别级物体姿态估计
计算机视觉与模式识别
2026-04-21 v1
摘要
类别级物体姿态估计是具身智能的基本问题,但实现对未见实例的鲁棒泛化仍具有挑战。然而,现有方法主要依赖简单的特征提取和聚合,难以捕获类别共享的拓扑结构并进行语义关键点建模,限制了其泛化能力。为此,我们提出一种基于语义 Mamba 的拓扑感知学习框架用于类别级物体姿态估计(TSM-Pose)。具体而言,我们引入拓扑提取器(Topology Extractor)来捕获点云的全局拓扑表示,该表示被整合到局部几何特征中, enables robust category-level structural representation。同时,我们提出基于 Mamba 的全局语义聚合器(Mamba-based Global Semantic Aggregator),将语义先验注入关键点以增强其表达能力,并利用多个 TwinMamba 块来建模长程依赖以实现更有效的全局特征聚合。在三个基准数据集(REAL275、CAMERA25 和 HouseCat6D)上的大量实验表明,TSM-Pose 超过了现有的领先方法。
引用
@article{arxiv.2604.16954,
title = {TSM-Pose: Topology-Aware Learning with Semantic Mamba for Category-Level Object Pose Estimation},
author = {Jinshuo Liu and Bingtao Ma and Junlin Su and Guanyuan Pan and Beining Wu and Cheng Yang and Jiaxuan Lu and Chenggang Yan and Shuai Wang},
journal= {arXiv preprint arXiv:2604.16954},
year = {2026}
}