如何确定黑盒视觉-语言模型的首选图像分布?
计算机视觉与模式识别
2024-10-17 v3
摘要
大型基础模型已在领域内实现了革命性发展,但在针对特定视觉任务优化多模态模型方面仍面临挑战。我们提出了一种新颖且可泛化的方法,用于识别黑盒视觉-语言模型(VLM)的首选图像分布,通过测量在不同输入提示下的输出一致性。将其应用于不同类型的3D对象的渲染,我们在各个需要精确解释复杂结构的领域中展示了其有效性,特别是以计算机辅助设计(CAD)为典型领域。我们进一步通过结合人类反馈进行情境学习来细化VLM的输出,显著提升了解释质量。为解决专业领域缺乏基准测试的现状,我们引入CAD-VQA,用于评估VLMs在CAD相关视觉问答任务上的性能。我们对最先进的VLMs在CAD-VQA上的评估建立了基准性能水平,为在各种需要专业视觉解释能力的领域中提升VLM在复杂视觉推理任务方面的能力提供了框架。我们在\url{https://github.com/asgsaeid/cad_vqa}上发布了数据集和评估代码。
引用
@article{arxiv.2409.02253,
title = {How to Determine the Preferred Image Distribution of a Black-Box Vision-Language Model?},
author = {Saeid Asgari Taghanaki and Joseph Lambourne and Alana Mongkhounsavath},
journal= {arXiv preprint arXiv:2409.02253},
year = {2024}
}
备注
Accepted to NeurIPS 2024, Safe Generative AI