TriFusion-AE:用于鲁棒点云处理的语言引导深度与 LiDAR 融合
计算机视觉与模式识别
2025-09-24 v1
摘要
基于 LiDAR 的感知是自动驾驶与机器人的核心,但原始点云仍极易受噪声、遮挡与对抗性损坏的影响。自编码器为去噪与重建提供了天然框架,但其性能在具有挑战性的现实条件下会退化。本文提出 TriFusion-AE,一种多模态交叉注意力自编码器,整合文本先验、来自多视角图像的单目深度图与 LiDAR 点云以提升鲁棒性。通过对齐来自文本的语义线索、来自图像的几何(深度)特征与来自 LiDAR 的空间结构,TriFusion-AE 学习了对随机噪声与对抗性扰动具有弹性的表示。有趣的是,尽管在轻微扰动下改进有限,我们的模型在强对抗攻击与重噪声下实现了显著更鲁棒的重建,而基于 CNN 的自编码器在此条件下崩溃。我们在 nuScenes-mini 数据集上进行评估,以反映现实的低数据部署场景。我们的多模态融合框架设计为模型无关的,能够与任何基于 CNN 的点云自编码器无缝集成以进行联合表示学习。
引用
@article{arxiv.2509.18743,
title = {TriFusion-AE: Language-Guided Depth and LiDAR Fusion for Robust Point Cloud Processing},
author = {Susmit Neogi},
journal= {arXiv preprint arXiv:2509.18743},
year = {2025}
}
备注
39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop