视觉语言模型在图像评分与自我解释中的迭代自我改进
计算机视觉与模式识别
2025-06-04 v1 计算与语言
摘要
图像评分在众多实际应用中是一项关键任务。要信任模型的判断,理解其背后的逻辑至关重要。本文提出了一种针对视觉语言模型的全新训练方法,使其不仅能生成图像评分,还能用自然语言生成相应的理由。仅利用一个图像评分数据集和一个经过指令微调的 VLM,我们的方法实现了自训练,利用 VLM 生成的文本,而不依赖外部数据或模型。此外,我们引入了一种简单的方法来创建数据集,旨在提高预测评分与其文本理由之间的对齐度。通过在两个不同的数据集上使用直接偏好优化迭代训练模型并将其合并,我们能够同时提高评分准确性和生成解释的连贯性。
引用
@article{arxiv.2506.02708,
title = {Iterative Self-Improvement of Vision Language Models for Image Scoring and Self-Explanation},
author = {Naoto Tanji and Toshihiko Yamasaki},
journal= {arXiv preprint arXiv:2506.02708},
year = {2025}
}
备注
Accepted to ICIP2025