基于感知运动的ViT框架用于单目6DoF航天器姿态估计
计算机视觉与模式识别
2025-09-09 v1
摘要
单目6DoF姿态估计在多个航天任务中发挥重要作用。大多数现有姿态估计方法依赖单张图像的静态关键点定位,未能利用空间操作中固有的宝贵时序信息。在本工作中,我们将来自人类姿态估计的深度学习框架应用于航天器姿态估计领域,该框架集成了感知运动的热力图和光流以捕获运动动态。我们的方法将来自Vision Transformer (ViT) 编码器的图像特征与来自预训练光流模型的运动线索相结合,以定位2D关键点。利用这些估计值,Perspective-n-Point (PnP)求解器从已知的2D-3D对应关系中恢复6DoF姿态。我们在SPADES-RGB数据集上进行训练和评估,并进一步在来自SPARK-2024数据集的真实和合成数据上测试其泛化能力。总体而言,我们的方法在2D关键点定位和6DoF姿态估计方面均优于单图像基线方法。此外,它在测试于不同数据分布时表现出有前景的泛化能力。
引用
@article{arxiv.2509.06000,
title = {Motion Aware ViT-based Framework for Monocular 6-DoF Spacecraft Pose Estimation},
author = {Jose Sosa and Dan Pineau and Arunkumar Rathinam and Abdelrahman Shabayek and Djamila Aouada},
journal= {arXiv preprint arXiv:2509.06000},
year = {2025}
}