TESGNN:用于高效鲁棒多视角三维场景理解的时序等变场景图神经网络
计算机视觉与模式识别
2025-11-04 v3 机器学习
摘要
场景图凭借其对关系信息的紧凑显式表示,已被证明对各类场景理解任务极为有效。然而,当前方法在从三维点云生成场景图时,往往忽视保持对称性的关键重要性,这会导致准确性和鲁棒性下降,特别是在处理含噪、多视角数据时。此外,先前方法的一个主要局限是缺乏时序建模,无法捕捉场景中动态演化实体间的时间依赖关系。为应对这些挑战,我们提出时序等变场景图神经网络(TESGNN),包含两个关键组件:(1) 等变场景图神经网络(ESGNN),从三维点云提取信息生成场景图,同时保持关键对称性质;(2) 时序图匹配网络,利用近似图匹配算法将 ESGNN 在多个时间序列上生成的场景图融合为统一的全局表示。实验表明,TESGNN 在场景图生成任务上优于现有方法,实现更高准确率和更快训练收敛。此外,我们证明利用对称性保持特性能产生比现有方法更稳定、更准确的全局场景表示。最后,该方法计算高效且易于用现有框架实现,适用于机器人和计算机视觉的实时应用。这为复杂多视角场景理解挑战铺平了更鲁棒、可扩展的解决方案之路。源代码公开可用:https://github.com/HySonLab/TESGraph
引用
@article{arxiv.2411.10509,
title = {TESGNN: Temporal Equivariant Scene Graph Neural Networks for Efficient and Robust Multi-View 3D Scene Understanding},
author = {Quang P. M. Pham and Khoi T. N. Nguyen and Lan C. Ngo and Truong Do and Dezhen Song and Truong-Son Hy},
journal= {arXiv preprint arXiv:2411.10509},
year = {2025}
}
备注
arXiv admin note: text overlap with arXiv:2407.00609