基于动作描述预测的具身导航辅助任务
计算机视觉与模式识别
2025-10-28 v1 机器人学
摘要
室内环境的多模态机器人导航领域近年来受到广泛关注。然而,随着任务和方法的日益复杂,决策系统倾向于变得更为复杂且运作为黑盒子。对于可靠的系统,解释或描述其决策的能力至关重要;但恰恰是由于解释型系统无法在性能方面超越非解释型系统。在本文中,我们提出将描述动作的任务纳入导航强化学习的辅助任务中。既有研究发现,将描述动作纳入强化学习困难在于缺乏ground-truth数据。我们通过从预训练的描述生成模型(如视觉语言模型)进行知识蒸馏来解决此问题。我们全面评估了该方法在各种导航任务中的效果,表明它能够在保持高性能的同时描述动作。此外,它在特别具有挑战性的语义音视频导航等多模态导航任务中实现了最先进的性能。
引用
@article{arxiv.2510.21809,
title = {Embodied Navigation with Auxiliary Task of Action Description Prediction},
author = {Haru Kondoh and Asako Kanezaki},
journal= {arXiv preprint arXiv:2510.21809},
year = {2025}
}
备注
ICCV 2025 Poster