中文

更好的监督式微调用于 VQA:整数-only loss

计算机视觉与模式识别 2025-08-18 v1 人工智能

摘要

随着视觉语言模型(VLM)的快速发展,其根据特定标准和维度评估视觉内容的能力日益关键,尤其是用于视频主题一致性评估和视觉质量评分。然而,现有方法常因结果不精确和损失计算效率低下,限制了模型对关键评估指标的关注。为此,我们提出一种针对 VLM 的新颖微调方法 IOVQA(Integer-only VQA),以增强其在视频质量评估任务中的性能。IOVQA 的关键创新在于其标签构建和针对性损失计算机制。具体而言,在数据集构建过程中,我们约束模型输出为 [10,50] 范围内的整数,确保数值稳定性,并在使用之前将小数 Overall_MOS 转换为整数。我们还引入目标掩码策略:在计算损失时,仅对标签的前两位整数进行遮蔽,迫使模型学习数值评估的关键组件。经过微调 Qwen2.5-VL 模型后,实验结果表明,该方法显著提升了模型在 VQA 任务中的准确性和一致性,排名位列 VQualA 2025 GenAI-Bench AIGC 视频质量评估挑战赛 Track I 第 3 位。我们的工作凸显了仅保留整数标签在微调中有效的想法,为优化定性评估场景中的 VLM 提供了有效思路。

关键词

引用

@article{arxiv.2508.11170,
  title  = {Better Supervised Fine-tuning for VQA: Integer-Only Loss},
  author = {Baihong Qian and Haotian Fan and Wenjie Liao and Yunqiu Wang and Tao Li and Junhui Cui},
  journal= {arXiv preprint arXiv:2508.11170},
  year   = {2025}
}