CVAM-Pose:用于多目标单目姿态估计的条件变分自编码器
计算机视觉与模式识别
2024-10-14 v1
摘要
估计刚性物体的姿态是计算机视觉中的一个基本问题,适用于 various automation and augmented reality applications。大多数现有方法采用每个物体类别一个网络的策略,依赖物体的 3D 模型、深度数据,并采用耗时的迭代细化,这在某些应用中可能不够实用。本文提出一种 novel 方法,CVAM-Pose,用于多目标单目姿态估计,以解决这些限制。CVAM-Pose 方法采用 label-embedded conditional variational autoencoder network,隐式地在单个低维潜在空间中抽象多个物体的正则化表示。这种自编码过程仅使用由 投影相机捕获的图像,并且对物体的遮挡和场景杂乱具有鲁棒性。物体的类别是 one-hot 编码的,并且贯穿整个网络嵌入。提出的 label-embedded pose regression strategy 解释所学习的潜在空间表示,利用连续姿态表示。消化测试和系统评估表明,CVAM-Pose 方法在多目标场景中具有可扩展性和效率。该方法在与竞争方法相比表现更好。例如,在 Linemod-Occluded 数据集上使用 指标评估时,CVAM-Pose 分别比 AAE 和 Multi-Path 方法高出 25% 和 20%。它还在 BOP 挑战中依赖 3D 模型的方法中取得了相当接近的结果。代码可用:https://github.com/JZhao12/CVAM-Pose
引用
@article{arxiv.2410.09010,
title = {CVAM-Pose: Conditional Variational Autoencoder for Multi-Object Monocular Pose Estimation},
author = {Jianyu Zhao and Wei Quan and Bogdan J. Matuszewski},
journal= {arXiv preprint arXiv:2410.09010},
year = {2024}
}
备注
BMVC 2024, oral presentation, the main paper and supplementary materials are included