面向视觉推理任务中非可微视觉编程框架的逐步蒸馏学习策略
计算机视觉与模式识别
2025-02-25 v3 人工智能
摘要
近来,视觉编程(VProg)因其可解释性和跨任务通用性,已成为视觉推理(VR)任务的重要框架。然而,即便调用强大的预训练视觉-语言模型(VLMs)作为视觉子模块,VProg 在特定 VR 任务上的性能仍明显逊于训练良好的任务专用网络。尽管调用任务专用模型可进一步提升 VProg 在特定 VR 任务上的性能,却极大损害了 VProg 的跨任务泛化能力。此外,VProg 的非可微特性阻碍了其针对特定 VR 任务的直接微调以进一步提升性能。为尝试解决这些问题,我们提出 SDVP,一种面向各类 VR 任务中非可微 VProg 的逐步蒸馏学习策略。具体而言,我们的 SDVP 将 VProg 中分解出的视觉子任务上现有训练良好的小型任务专用模型的能力,逐步蒸馏到对应视觉子模块所调用的更大规模 VLMs 中。此外,将小尺寸任务专用模型的知识蒸馏进预训练更大 VLMs 而非替换它们,有助于保持 VProgs 的跨任务能力。在不同 VProg 框架上的广泛而全面的实验结果表明,我们的 SDVP 在特定 VR 基准上获得了显著性能增益,即 VisProg 的 GQA (+2.4%) 和 NLVRv2 (+6.2%),以及 ViperGPT 的 GQA (+6.5%) 和 NLVRv2 (+4.0%),并且在未见过和先前的 VR 任务上保持了 VProg 的良好性能。
引用
@article{arxiv.2309.09809,
title = {A Stepwise Distillation Learning Strategy for Non-differentiable Visual Programming Frameworks on Visual Reasoning Tasks},
author = {Wentao Wan and Nan Kang and Zeqing Wang and Zhuojie Yang and Liang Lin and Keze Wang},
journal= {arXiv preprint arXiv:2309.09809},
year = {2025}
}