中文

简洁而有效:用于具身人工智能的 CLIP 嵌入

计算机视觉与模式识别 2022-04-18 v2 机器学习

摘要

对比语言-图像预训练(CLIP)编码器已被证明对一系列视觉任务有益,从分类、检测到图像描述与图像操控。我们研究了 CLIP 视觉骨干网络在具身人工智能(Embodied AI)任务中的有效性。我们构建了极为简单的基线,称为 EmbCLIP,不含任务特定架构、归纳偏置(例如使用语义地图)、训练中的辅助任务或深度图——然而我们发现,我们改进的基线在一系列任务和模拟器中表现非常出色。EmbCLIP 以 20 分的巨大优势(成功率)登顶 RoboTHOR ObjectNav 排行榜。它登顶 iTHOR 1-Phase Rearrangement 排行榜,击败了采用主动神经映射(Active Neural Mapping)的下一最佳提交,并将 % Fixed Strict 指标翻倍有余(0.08 至 0.17)。它还击败了 2021 年 Habitat ObjectNav 挑战赛(采用辅助任务、深度图与人工演示)以及 2019 年 Habitat PointNav 挑战赛的获胜者。我们评估了 CLIP 的视觉表征在捕获关于输入观测的语义信息方面的能力——这些原语对导航密集的具身任务有用——并发现 CLIP 的表征比 ImageNet 预训练骨干网络更有效地编码这些原语。最后,我们扩展了我们的一条基线,产生了一个能够进行零样本物体导航的智能体,可导航至训练期间未作为目标使用的物体。我们的代码与模型可在 https://github.com/allenai/embodied-clip 获取。

关键词

引用

@article{arxiv.2111.09888,
  title  = {Simple but Effective: CLIP Embeddings for Embodied AI},
  author = {Apoorv Khandelwal and Luca Weihs and Roozbeh Mottaghi and Aniruddha Kembhavi},
  journal= {arXiv preprint arXiv:2111.09888},
  year   = {2022}
}

备注

Published in CVPR 2022