基于自我完善数据飞轮的语言引导导航学习引导
计算机视觉与模式识别
2025-03-03 v2 人工智能
计算与语言
摘要
为训练健壮的语言指令智能体收集高质量数据始终是具身 AI 中的长期挑战。本文引入一种自我完善数据飞轮(Self-Refining Data Flywheel, SRDF),通过两个模型(指令生成器和导航器)在没有人类标注的情况下协作不断精炼数据池,生成高质量且大规模的导航指令-轨迹对。具体而言,SRDF首先使用基础生成器创建初始数据池以训练基础导航器,然后应用训练好的导航器筛选数据池。这导致更高保真度的数据用于训练更好的生成器,进而为训练下一轮导航器生产更高质量的数据。如此形成的数据自我完善过程,为大规模语言引导导航学习生成持续改进且高效的数据集。我们的实验表明,经过数轮飞轮循环后,导航器在经典 R2R 测试集上的性能边界从 70% 提升至 78%,首次超越人类水平(76%)。同时,该过程还产生了优异的生成器,SPICE 提升至 26.2,优于所有以往的视觉-语言导航指令生成方法。最后,我们通过增加环境和指令的多样性展示了方法的可扩展性,并证明了预训练导航器在各种下游导航任务中的泛化能力,在所有案例中均显著优于最新方法。
引用
@article{arxiv.2412.08467,
title = {Bootstrapping Language-Guided Navigation Learning with Self-Refining Data Flywheel},
author = {Zun Wang and Jialu Li and Yicong Hong and Songze Li and Kunchang Li and Shoubin Yu and Yi Wang and Yu Qiao and Yali Wang and Mohit Bansal and Limin Wang},
journal= {arXiv preprint arXiv:2412.08467},
year = {2025}
}
备注
28 pages, Code and data are available at https://github.com/wz0919/VLN-SRDF