主动开放词汇识别:以智能移动缓解 CLIP 的局限
计算机视觉与模式识别
2023-12-01 v1
摘要
主动识别允许智能体通过探索观测来提升识别性能,是抓取、导航和房间布置等多种具身 AI 任务的先决条件。鉴于环境的不断演化以及物体类别的繁多,在训练阶段囊括所有可能的类别是不现实的。本文旨在推进主动开放词汇识别,使具身智能体能够主动感知并对任意物体进行分类。然而,直接采用近期的开放词汇分类模型(如 Contrastive Language Image Pretraining (CLIP))会带来其特有的挑战。具体而言,我们观察到 CLIP 的性能深受视角与遮挡的影响,这在无约束的具身感知场景中削弱了其可靠性。此外,智能体与环境交互中观测的序列特性要求一种有效的特征融合方法,以在开放词汇分类中保持判别力。为解决这些问题,我们提出了一种用于主动开放词汇识别的新型智能体。所提方法利用帧间与概念间的相似性来引导智能体运动并融合特征,且不依赖类别特定知识。相较于在 ShapeNet 数据集上准确率为 29.6% 的基线 CLIP 模型,所提智能体在无需对所用 CLIP 模型进行任何微调的情况下,开放词汇识别准确率可达 53.3%。基于 Habitat 模拟器的额外实验进一步证实了方法的有效性。
引用
@article{arxiv.2311.17938,
title = {Active Open-Vocabulary Recognition: Let Intelligent Moving Mitigate CLIP Limitations},
author = {Lei Fan and Jianxiong Zhou and Xiaoying Xing and Ying Wu},
journal= {arXiv preprint arXiv:2311.17938},
year = {2023}
}