视觉与语言导航智能体的行为分析
计算机视觉与模式识别
2023-07-21 v1 机器人学
摘要
为了取得成功,视觉与语言导航(VLN)智能体必须能够根据其周围环境将指令 grounding 为动作。在这项工作中,我们开发了一种在技能特定基础上研究智能体行为的方法——考察现有智能体对关于停止、转向以及向指定物体或房间移动的指令的 grounding 程度。我们的方法基于生成技能特定的干预并测量智能体预测的变化。我们提出了一个详细的案例研究来分析一个近期智能体的行为,然后基于技能特定的能力分数对多个智能体进行比较。该分析表明,来自训练的偏差对智能体行为具有持久影响,且现有模型能够对简单的指代表达式进行 grounding。我们模型间的比较显示,技能特定的分数与整体 VLN 任务性能的改进相关。
引用
@article{arxiv.2307.10790,
title = {Behavioral Analysis of Vision-and-Language Navigation Agents},
author = {Zijiao Yang and Arjun Majumdar and Stefan Lee},
journal= {arXiv preprint arXiv:2307.10790},
year = {2023}
}
备注
accepted to CVPR2023