利用视觉强化自训练大型语言模型以改进视觉程序合成
计算机视觉与模式识别
2024-04-09 v1
摘要
视觉程序合成是一种有前景的方法,旨在利用大型语言模型的推理能力来完成组合计算机视觉任务。先前的工作使用冻结的 LLM 进行少样本提示以合成视觉程序。训练 LLM 以编写更好的视觉程序是一个有吸引力的前景,但如何实现这一点尚不清楚。目前不存在用于训练的视觉程序数据集,而且由于需要专家标注员,视觉程序数据集也无法轻易通过众包获取。为了绕过缺乏直接监督的问题,我们探索利用交互经验的反馈来提高 LLM 的程序合成能力。我们提出了一种方法,利用视觉-语言任务的现有标注为该任务即兴构建粗略的奖励信号,将 LLM 视为策略,并应用强化自训练来提高 LLM 在该任务中的视觉程序合成能力。我们描述了在目标检测、组合视觉问答和图像-文本检索上的一系列实验,并表明在每种情况下,自训练的 LLM 的表现优于或表现持平于大一个数量级的少样本冻结 LLM。网站:https://zaidkhan.me/ViReP
引用
@article{arxiv.2404.04627,
title = {Self-Training Large Language Models for Improved Visual Program Synthesis With Visual Reinforcement},
author = {Zaid Khan and Vijay Kumar BG and Samuel Schulter and Yun Fu and Manmohan Chandraker},
journal= {arXiv preprint arXiv:2404.04627},
year = {2024}
}
备注
CVPR 2024