MiniVLN:基于渐进式知识蒸馏的高效视觉与语言导航
计算机视觉与模式识别
2024-09-30 v1
摘要
近年来,具身人工智能(Embodied AI)发展迅速,但模型日益增大的规模与 Embodied AI 平台有限的计算能力产生了冲突。为了应对这一挑战,我们旨在同时实现高模型性能和实际可部署性。具体而言,我们聚焦于视觉与语言导航(VLN),这是 Embodied AI 中的一项核心任务。本文引入了一个两阶段知识蒸馏框架,生成了学生模型 MiniVLN,并展示了蒸馏技术在开发轻量级模型方面的巨大潜力。所提方法旨在在预训练阶段捕获细粒度知识,并在微调阶段捕获特定于导航的知识。研究结果表明,与单阶段蒸馏相比,两阶段蒸馏方法在缩小教师模型与学生模型之间的性能差距方面更为有效。在公开的 R2R 和 REVERIE 基准测试上,MiniVLN 取得了与教师模型相当的性能,而其参数量仅为教师模型的约 12%。
引用
@article{arxiv.2409.18800,
title = {MiniVLN: Efficient Vision-and-Language Navigation by Progressive Knowledge Distillation},
author = {Junyou Zhu and Yanyuan Qiao and Siqi Zhang and Xingjian He and Qi Wu and Jing Liu},
journal= {arXiv preprint arXiv:2409.18800},
year = {2024}
}