中文

面向室内建筑环境机器人场景理解的具有不确定性对齐的开放词汇语义分割

计算机视觉与模式识别 2025-04-01 v1

摘要

全球身体残疾人数量的增加(部分由于创伤后存活率和寿命的提高),放大了对先进辅助技术以改善移动性和独立性的需求。自主辅助机器人(如智能轮椅)需要强大的空间分割和语义识别能力,才能在复杂的建成环境中有效导航。地点分割涉及划定房间或功能区域等空间区域,而语义识别则为这些区域分配语义标签,从而实现针对用户特定需求的准确定位。现有方法通常利用深度学习;然而,这些闭集词汇检测系统难以解释直观和随意的人类指令。此外,大多数现有方法忽略了场景识别问题中的不确定性,导致成功率较低,特别是在模糊和复杂的环境中。为了应对这些挑战,我们提出了一种利用视觉语言模型和大型语言模型的开放词汇场景语义分割与检测流水线。我们的方法遵循用于开放词汇场景分类的“分割-检测-选择”框架,为辅助机器人在建成环境中实现自适应和直观的导航。

关键词

引用

@article{arxiv.2503.23105,
  title  = {Open-Vocabulary Semantic Segmentation with Uncertainty Alignment for Robotic Scene Understanding in Indoor Building Environments},
  author = {Yifan Xu and Vineet Kamat and Carol Menassa},
  journal= {arXiv preprint arXiv:2503.23105},
  year   = {2025}
}

备注

32 pages, 7 figures