PQ-Transformer:从点云联合解析三维物体与布局
计算机视觉与模式识别
2022-01-11 v2
摘要
从点云进行三维场景理解对各种机器人应用至关重要。不幸的是,当前最先进的方法对不同任务(如物体检测或房间布局估计)使用分离的神经网络的。这种方案有两个局限:1)为不同任务存储和运行多个网络对典型机器人平台而言代价高昂。2)分离输出的内在结构被忽略且可能被违背。为此,我们提出首个使用点云输入同时预测三维物体与布局的transformer架构。不同于现有估计布局关键点或边的方法,我们直接将房间布局参数化为一组四边形(quad)。因此,所提架构被称为P(oint)Q(uad)-Transformer。连同新颖的四边形表示,我们提出一种定制的物理约束损失函数以抑制物体-布局干涉。在公开基准ScanNet上的定量与定性评估表明,所提PQ-Transformer成功联合解析三维物体与布局,以准实时(8.91 FPS)速率运行而无需面向效率的优化。此外,新物理约束损失可改进强基线,房间布局的F1分数从37.9%显著提升至57.9%。
引用
@article{arxiv.2109.05566,
title = {PQ-Transformer: Jointly Parsing 3D Objects and Layouts from Point Clouds},
author = {Xiaoxue Chen and Hao Zhao and Guyue Zhou and Ya-Qin Zhang},
journal= {arXiv preprint arXiv:2109.05566},
year = {2022}
}
备注
Code: https://github.com/OPEN-AIR-SUN/PQ-Transformer