基于模板的视觉程序蒸馏
计算机视觉与模式识别
2025-11-05 v4 计算与语言
摘要
将视觉编程或提示大型语言模型(LLM)以生成执行视觉任务(如视觉问答(VQA)等特定任务或领域的代码,由于高的标注和推理成本,仍然具有挑战性。我们提出一种低成本的视觉程序蒸馏方法,可用于参数最多为10亿的模型,且无需人工生成的程序标注。通过将程序解耦为称为模板的高级技能及其相应参数的合成数据增强来实现。实验结果表明,在相当小的问答数据量下,小型语言模型能够生成高质量的专业视觉程序,同时实现更快的推理速度。
引用
@article{arxiv.2412.08564,
title = {Visual Program Distillation with Template-Based Augmentation},
author = {Michal Shlapentokh-Rothman and Yu-Xiong Wang and Derek Hoiem},
journal= {arXiv preprint arXiv:2412.08564},
year = {2025}
}
备注
EMNLP Camera Ready