学习如何提问:循环一致性细化多模态基础模型中的提示
计算与语言
2024-02-15 v1 计算机视觉与模式识别
摘要
当 LLM 执行零-shot 推理时,他们通常使用带有任务说明的提示并生成补全。然而,目前尚无工作探索从补全到任务说明的可能性。本文利用两种方向进行循环监督式学习,完全在上下文中完成。我们的目标是创建前向映射 f : X -> Y (例如,图像 -> 生成的标题),以及后向映射 g : Y -> X (例如,标题 -> 生成的图像),以构建一种称为循环一致性的“损失”(表述为对提示的更新),以确保 g(f(X)) ~= X。该技术称为 CyclePrompt,使用循环一致性作为免费监督信号来迭代精炼提示。重要的是,CyclePrompt 在不进行高昂的微调、不使用训练数据、以及不依赖外部环境(如编译器、API)的复杂性方面,能够强化模型性能。我们在两个领域展示了 CyclePrompt:代码生成和图像标题生成。在 HumanEval 编码基准测试中,我们在不依赖额外训练数据或使用外部环境的模型中名列前茅,整体排名第三。相较于 GPT4 基线,我们将准确率从 80.5% 提升至 87.2%。在视觉语言领域,我们生成的详细图像标题在针对自然(VQAv2)和图示(FigureQA)视觉问答基准测试时的表现优于零-shot GPT4V 标题。据我们了解,这是首次将自监督学习用于提示设计。
引用
@article{arxiv.2402.08756,
title = {Learning How To Ask: Cycle-Consistency Refines Prompts in Multimodal Foundation Models},
author = {Maurice Diesendruck and Jianzhe Lin and Shima Imani and Gayathri Mahalingam and Mingyang Xu and Jie Zhao},
journal= {arXiv preprint arXiv:2402.08756},
year = {2024}
}