TB-HSU: 基于上下文功能可及性的层次化三维场景理解
计算机视觉与模式识别
2025-02-25 v2
摘要
功能与可及性的概念是三维场景理解的关键方面,支持面向任务的目标。在本工作中,我们开发了一种模型,能够在一个表示场景空间组织的三维层次化场景图(3DHSG)上学习和结构化及变化功能可及性。变化的功能可及性被设计为与图的 varying 空间上下文相集成。具体而言,我们开发了一种算法来构建一个三维层次化场景图(3DHSG),以捕捉场景的空间组织。从分割后的物体点云和物体语义标签出发,我们构建了一个具有顶层节点(标识房间标签)、子节点(定义房间内具有区域特定功能可及性的局部空间区域)和孙节点(指示物体位置及物体特定功能可及性)的3DHSG。为了支持本工作,我们创建了一个自定义的3DHSG数据集,为局部空间区域提供具有区域特定功能可及性的真值数据,也为每个物体提供物体特定功能可及性。我们采用基于Transformer的模型来学习3DHSG。我们使用一个多任务学习框架,同时学习房间分类以及定义房间内具有区域特定功能可及性的空间区域。我们的工作在性能上优于最先进基线模型,并展示了将Transformer模型应用于三维场景理解和生成捕捉房间空间组织的3DHSG的一种方法。代码和数据集公开发布。
引用
@article{arxiv.2412.05596,
title = {TB-HSU: Hierarchical 3D Scene Understanding with Contextual Affordances},
author = {Wenting Xu and Viorela Ila and Luping Zhou and Craig T. Jin},
journal= {arXiv preprint arXiv:2412.05596},
year = {2025}
}
备注
Accepted by AAAI2025