通过对抗路径采样实现反事实视觉与语言导航
计算机视觉与模式识别
2025-03-18 v4
摘要
视觉与语言导航(VLN)是一项智能体必须决定如何在 3D 环境中移动,通过将自然语言指令接地于视觉环境来到达目标的任务。VLN 任务的问题之一是数据稀缺,因为难以为交互式环境收集足够带人工标注指令的导航路径。本文中,我们探索将反事实思维作为一种受人类启发的数据增强方法,以得到鲁棒模型。反事实思维是描述人类倾向于对已发生生活事件创造可能替代方案的概念。我们提出一种对抗驱动的反事实推理模型,可考虑有效条件而非低质量增强数据。具体而言,我们提出一个模型无关的对抗路径采样器(APS),其学习采样具有挑战性的路径,以根据导航表现迫使导航器改进。APS 也用于对未见环境进行预探索,以加强模型的泛化能力。我们使用 room-to-room 数据集(R2R)评估 APS 对不同 VLN 基线模型表现的影响。结果显示,我们提出的 APS 的对抗训练过程在已见与未见环境下均有益于 VLN 模型。并且预探索过程可在未见环境下进一步获得额外提升。
引用
@article{arxiv.1911.07308,
title = {Counterfactual Vision-and-Language Navigation via Adversarial Path Sampling},
author = {Tsu-Jui Fu and Xin Eric Wang and Matthew Peterson and Scott Grafton and Miguel Eckstein and William Yang Wang},
journal= {arXiv preprint arXiv:1911.07308},
year = {2025}
}
备注
ECCV'20 (Spotlight)