拆解与重构:基于技能的视觉语言导航代理混合体
人工智能
2026-05-14 v4 计算与语言
计算机视觉与模式识别
摘要
视觉语言导航(VLN)为代理解释自然语言指令并导航至复杂 3D 环境带来了显著挑战。尽管近期进展得益于大规模预训练和数据增强,但当前方法仍难以泛化到未见情景,尤其是在需要复杂空间和时间推理时。本文提出了 SkillNav,一种引入结构化、技能导向推理的模块化框架,用于 Transformer 基于 VLN 代理。我们的方法将导航分解为一组可解释的原子技能(如垂直运动、区域识别、停止和暂停),每个技能由专门的代理处理。为支持无需手动数据标注的针对性技能训练,我们构建了一个合成数据管道,生成多样化、语言自然、技能特定的指令-轨迹对。我们然后引入一种新型基于 Vision-Language Model(VLM)的无训练路由器,通过对齐子目标与视觉观察和历史动作,动态选择每个时间步骤中最合适的代理。SkillNav 在常用基准测试上获得了竞争结果,并在具有新指令样式和未见环境的 GSA-R2R 基准测试上实现了最先进的泛化。
引用
@article{arxiv.2508.07642,
title = {Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents},
author = {Tianyi Ma and Yue Zhang and Zehao Wang and Parisa Kordjamshidi},
journal= {arXiv preprint arXiv:2508.07642},
year = {2026}
}
备注
Accepted by ACL 2026 Main Conference