超越准确率:微调对视觉语言模型预测合理性的影响
机器学习
2025-02-26 v2
摘要
诸如 CLIP 之类的视觉语言模型(VLM)已得到广泛应用。研究人员积极致力于在安全关键领域进一步微调 VLM。在这些领域中,预测合理性至关重要:预测不仅应当正确,还需基于有效证据。然而,对于 VLM 而言,微调对预测合理性的影响鲜少被研究。为研究此问题,我们提出了两个新指标:预测可信度与推理可靠性。我们在多种设置下进行了大量实验,并观察到一些有趣的现象。一方面,我们发现广泛采用的微调方法会导致模型基于无效证据做出更多正确预测。这可能会损害微调后 VLM 正确预测的可信度。另一方面,在识别出目标对象的有效证据后,微调后的 VLM 更有可能做出正确预测。此外,在分布偏移及各种实验设置下,这些发现均保持一致。我们希望本研究能为 VLM 微调提供新的见解。
引用
@article{arxiv.2412.13333,
title = {Beyond Accuracy: On the Effects of Fine-tuning Towards Vision-Language Model's Prediction Rationality},
author = {Qitong Wang and Tang Li and Kien X. Nguyen and Xi Peng},
journal= {arXiv preprint arXiv:2412.13333},
year = {2025}
}
备注
In Proceedings of the Association for the Advancement of Artificial Intelligence (AAAI), 2025