中文

通过试问选择微调示例:面向视觉语言模型的QZLoRA框架

机器学习 2025-11-18 v1 计算机视觉与模式识别

摘要

为特定主题对文本到图像扩散模型进行微调时,如何选择优质示例是一个挑战。来自质量参差不齐图像集(如维基百科公共资源)的微调数据常会产生差异结果。然而,能够体现目标概念(如雌性山蓝鸟)的训练图像有助于确保生成图像具有代表性(如具有典型的蓝翅和灰胸)。本文提出QZLoRA框架,通过将图像视为"教育干预"并"试问"视觉语言模型(VLM)来自动对图像进行排序,从而选择低秩适应(LoRA)所需的微调示例。我们展示QZLoRA能够用更少的样本生成更具对齐性和写实性的图像。我们还表明,这些微调后的模型能够生成同样具代表性的风格化图像(即插图)。我们的结果凸显了将自动化视觉推理与参数高效微调结合用于主题自适应生成建模的潜力。

关键词

引用

@article{arxiv.2511.12002,
  title  = {Selecting Fine-Tuning Examples by Quizzing VLMs},
  author = {Tenghao Ji and Eytan Adar},
  journal= {arXiv preprint arXiv:2511.12002},
  year   = {2025}
}