基于Legendre卷积与注意力机制的6D物体姿态估计新模型
计算机视觉与模式识别
2026-01-08 v2 机器学习
摘要
本文提出PoseLecTr,一种基于图的编码器-解码器框架,集成新型Legendre卷积与注意力机制,用于从单目RGB图像进行六自由度(6-DOF)物体姿态估计。传统学习方法主要依赖网格结构卷积,难以在杂乱或遮挡场景中建模更高阶和长程依赖关系。PoseLecTr通过从图像特征构建图表示,其中通过图连通性显式建模空间关系来克服这一限制。该框架包含Legendre卷积层以提高图卷积的数值稳定性,同时引入空间注意力和自注意力蒸馏以增强特征选择。在LINEMOD、Occluded LINEMOD和YCB-VIDEO数据集上的实验表明,我们的方法实现了竞争性能,在广泛的物体和场景复杂性方面均取得一致性改进。
引用
@article{arxiv.2501.01993,
title = {A Novel Convolution and Attention Mechanism-based Model for 6D Object Pose Estimation},
author = {Alexander Du and Xiujin Liu},
journal= {arXiv preprint arXiv:2501.01993},
year = {2026}
}
备注
6 pages, 2 figures, 3 tables