中文

Flex-Judge:文本推理解放零样本多模态评估器

计算与语言 2025-10-21 v4 人工智能

摘要

人类生成的奖励信号是对齐生成模型以人类偏好为导向的关键因素,指导训练和推理时的评估。虽然大型语言模型 (LLM) 作为代理评估器显著减少了与手动注释相关的成本,但它们通常需要大量模态特定的训练数据,并且难以在多样化的多模态任务上获得良好泛化。本文提出 Flex-Judge,一种利用最小文本推理数据来在多模态和评估格式之间实现稳健泛化的推理引导型多模态评判模型。我们的核心直觉是,结构化的文本推理解释天然地编码了通用的决策模式,从而实现对多模态判断(例如图像或视频)的有效迁移。实证结果表明,尽管 Flex-Judge 在显著少于文本数据方面进行训练,却实现了与最先进商业 API 和广泛训练的多模态评估器相当或更好的性能。值得注意的是,Flex-Judge 在分子等模态领域具有广泛影响力,因为这些领域缺乏全面的评估基准,这凸显了其在资源受限领域的实际价值。我们的框架突显了基于推理的文本监督作为传统注释密集方法的强大且高效的替代方案,显著推动了可扩展的多模态模型评估。

关键词

引用

@article{arxiv.2505.18601,
  title  = {Flex-Judge: Text-Only Reasoning Unleashes Zero-Shot Multimodal Evaluators},
  author = {Jongwoo Ko and Sungnyun Kim and Sungwoo Cho and Se-Young Yun},
  journal= {arXiv preprint arXiv:2505.18601},
  year   = {2025}
}

备注

NeurIPS 2025