生成融合细粒度对齐标注的视觉语言导航指令
计算机视觉与模式识别
2025-06-11 v1
摘要
视觉语言导航(VLN)使智能体能够通过整合视觉感知和自然语言指令来导航环境,但面临细粒度跨模态对齐标注稀缺的显著挑战。现有数据集主要关注全局指令-轨迹匹配,忽略了对准确导航行动决策至关重要的子指令级和实体级对齐。为解决这一限制,我们提出了 FCA-NIG,一个自动构建融合双级细粒度跨模态标注的生成框架。在该框架中,首先将增强轨迹划分为子轨迹,然后通过 GLIP-based 地标检测、指令构建、OFA-Speaker 基于 R2R 的指令生成和 CLIP 驱动的实体选择,生成带有实体-地标标注的子指令-子轨迹对。最后,将这些子对聚合以形成完整的指令-轨迹对。框架生成了 FCA-R2R 数据集,这是第一个具有精确子指令-子轨迹和实体-地标对齐的大规模增强数据集。广泛的实验表明,使用 FCA-R2R 训练显著提高了多个最先进 VLN 代理的性能,包括 SF、EnvDrop、RecBERT 和 HAMT。融合子指令-轨迹对齐增强了代理的状态意识和决策准确性,而实体-地标对齐进一步提升了导航性能和泛化能力。这些结果凸显了 FCA-NIG 在无需手动标注的情况下生成高质量、可扩展训练数据的有效性,推动了复杂导航任务中细粒度跨模态学习的发展。
引用
@article{arxiv.2506.08566,
title = {Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations},
author = {Yibo Cui and Liang Xie and Yu Zhao and Jiawei Sun and Erwei Yin},
journal= {arXiv preprint arXiv:2506.08566},
year = {2025}
}