面向目标导向机器人视觉的早期融合
计算机视觉与模式识别
2019-08-09 v3 机器人学
摘要
在紧计算预算下构建性能良好的机器人感知系统,需要重新思考传统计算机视觉流程的新颖架构。现代视觉架构要求智能体构建整个场景的摘要表示,即使大部分输入与智能体当前目标无关。本工作中,我们翻转这一范式,引入 EarlyFusion 视觉模型,其以目标为条件构建用于下游任务的定制表示。我们表明,这些目标特定表示比我们领域现有注意力机制学习更快、参数效率显著更高且更鲁棒。我们在通过模仿学习以完全端到端方式训练的模拟机器人物品检索问题上展示了这些方法的有效性。
引用
@article{arxiv.1811.08824,
title = {Early Fusion for Goal Directed Robotic Vision},
author = {Aaron Walsman and Yonatan Bisk and Saadia Gabriel and Dipendra Misra and Yoav Artzi and Yejin Choi and Dieter Fox},
journal= {arXiv preprint arXiv:1811.08824},
year = {2019}
}