中文

基于 Cauchy 混合模型的文本到点云定位框架 CMMLoc

计算机视觉与模式识别 2025-03-21 v3

摘要

基于语言描述进行点云定位的目标是使用文本描述在大型城市环境中识别 3D 位置,这在 various fields 中具有潜在应用,例如确定车辆接送或货物配送的地点。理想情况下,对于给定的文本描述和对应的 3D 位置,围绕该 3D 位置的物体应完整地在文本描述中被描述。然而,在实际场景中,例如车辆接送,乘客通常只描述最显著且最近的周围环境的部分,而非整个环境。针对这种 \textbf{部分相关} 的挑战,我们提出了 \textbf{CMMLoc},一个以 \textbf{Cauchy} -\textbf{Mixture} -\textbf{Model} (\textbf{CMM}) 为基础的、具备不确定性感知能力的 \textbf{text-to-point-cloud} \textbf{Loc}alization 框架。为了建模文本与点云之间的不确定语义关系,我们将 CMM 约束作为先验集成到两者的交互中。我们进一步设计了空间整合方案,以启用对不同感受野的 3D 物体进行自适应聚合。为实现精确定位,我们提出了 cardinal direction integration 模块,辅以模态预对齐策略,帮助捕捉物体之间的空间关系,并将 3D 物体拉近文本模态。全面实验验证了 CMMLoc 优于现有方法, 在 KITTI360Pose 数据集上实现了最新的性能。代码可在本 GitHub 仓库 https://github.com/kevin301342/CMMLoc 中获取。

关键词

引用

@article{arxiv.2503.02593,
  title  = {CMMLoc: Advancing Text-to-PointCloud Localization with Cauchy-Mixture-Model Based Framework},
  author = {Yanlong Xu and Haoxuan Qu and Jun Liu and Wenxiao Zhang and Xun Yang},
  journal= {arXiv preprint arXiv:2503.02593},
  year   = {2025}
}

备注

Accepted by CVPR 2025