中文

BYE:基于单序列探索数据的通用点云编码器用于长期动态场景理解

机器人学 2024-12-04 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

动态场景理解始终是机器人应用中的挑战。早期的动态映射方法侧重于通过遮蔽或跟踪特定类别来缓解短期动态对象对相机运动估计的负面影响,这些方法往往不足以适应长期场景变化。最近的研究尝试使用在合成数据集上训练的神经网络来解决长期动态环境中的对象关联问题,但仍依赖于预定义的对象形状和类别。其他方法则采用视觉、几何或语义启发式方法进行关联,但常缺乏鲁健性。本文引入BYE,一种面向每个场景的类别无关点云编码器,无需预定义类别、形状先验或大量关联数据集。仅需训练一个探索序列,BYE即可高效地对动态变化的场景执行对象关联。我们进一步提出了一种集成方案,将视觉语言模型(VLM)的语义优势与BYE的场景专长相结合,在对象关联任务中实现7%的改进和95%的成功率。代码和数据集已公开于https://byencoder.github.io。

关键词

引用

@article{arxiv.2412.02449,
  title  = {BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding},
  author = {Chenguang Huang and Shengchao Yan and Wolfram Burgard},
  journal= {arXiv preprint arXiv:2412.02449},
  year   = {2024}
}