中文

面向真实场景的小型 LVLM 评判器部署:经验教训与最佳实践

计算与语言 2025-10-13 v2 机器学习

摘要

仅有7B参数的大型视觉语言模型 (LVLM) 已在图表理解任务中显示出作为自动评判器的潜力。然而,小型模型(≤2B参数)作为评判器仍表现不佳,限制了其在资源受限环境中的实际应用。为此,我们提出两种方法确保成本效益的评估:(i) 多准则提示,将多个独立评估准则组合到单个查询中;(ii) 领域适应迁移学习,在图表数据集上针对合成评判微调2B参数的 LVLM 以创建 ChartJudge。实验表明,多准则提示暴露了鲁棒性差距,导致7B模型(包括专用 LVLM 评判器如 LLaVA-Critic)的性能大幅下降。此外,我们发现我们的小型 LVLM (ChartJudge) 能够有效地从一个数据集传递知识到另一个数据集,从而成为更专业的模型。我们对图表类型和查询复杂度进行的细粒度分析提供了关于模型规模、提示设计和可迁移性之间的权衡的可操作性见解,使图表推理任务的可扩展低成本评估成为可能。

关键词

引用

@article{arxiv.2510.07545,
  title  = {Deploying Tiny LVLM Judges for Real-World Evaluation of Chart Models: Lessons Learned and Best Practices},
  author = {Md Tahmid Rahman Laskar and Mohammed Saidul Islam and Ridwan Mahbub and Mizanur Rahman and Amran Bhuiyan and Israt Jahan and Mir Tafseer Nayeem and Shafiq Joty and Enamul Hoque and Jimmy Huang},
  journal= {arXiv preprint arXiv:2510.07545},
  year   = {2025}
}

备注

Accepted to the EMNLP 2025 Industry Track