中文

TDANet:具备零样本能力的面向目标注意力目标视觉导航网络

计算机视觉与模式识别 2024-08-13 v2 机器人学

摘要

由于目标类别和放置位置在新的测试环境中会发生变化,端到端深度强化学习 (DRL) 在目标视觉导航中的泛化是一个长期存在的挑战。学习领域无关的视觉表示对于使训练好的 DRL 智能体具备泛化到未见场景和目标的能力至关重要。在本文中,提出了一种面向目标注意力网络 (TDANet),以学习具备零样本能力的端到端目标视觉导航策略。TDANet 具有一个新颖的目标注意力 (TA) 模块,该模块学习目标之间的空间和语义关系,以帮助 TDANet 聚焦于与目标最相关的观测目标。通过孪生架构 (SA) 设计,TDANet 区分当前状态与目标状态之间的差异,并生成领域无关的视觉表示。为了评估 TDANet 的导航性能,在 AI2-THOR 具身 AI 环境中进行了大量实验。仿真结果证明了 TDANet 对未见场景和目标物体具有很强的泛化能力,其导航成功率 (SR) 和路径长度加权成功率 (SPL) 高于其他 SOTA 模型。TDANet 最终部署在轮式机器人上并在真实场景中进行测试,证明了 TDANet 向真实世界的令人满意的泛化能力。

关键词

引用

@article{arxiv.2404.08353,
  title  = {TDANet: Target-Directed Attention Network For Object-Goal Visual Navigation With Zero-Shot Ability},
  author = {Shiwei Lian and Feitian Zhang},
  journal= {arXiv preprint arXiv:2404.08353},
  year   = {2024}
}