基于多任务强化学习的 MLLM-as-a-Judge 增强框架
计算与语言
2026-04-22 v2
摘要
多模态大语言模型 (MLLM) 因其在多种视觉任务中与人类判断高度一致, 已被广泛用作 MLLM-as-a-Judge。然而, 大多数现有评判模型针对单一任务优化, 难以在多样化情境中泛化, 这削弱了其可靠评估的关键要求。为此, 本文提出了基于多任务强化学习的 MLLM-as-a-Judge 框架 (MT-RL-Judge), 通过在多个任务上联合优化评判模型, 利用强化学习的泛化能力。实验结果表明, MT-RL-Judge 在判断一致性和与人类偏好相关性方面均优于多个强基线。此外, 本方法在分布外任务上展现出鲁棒的泛化能力, 进一步验证了其有效性。
引用
@article{arxiv.2603.11665,
title = {Multi-Task Reinforcement Learning for Enhanced Multimodal LLM-as-a-Judge},
author = {Junjie Wu and Xuan Kan and Zihao He and Shunwen Tan and Bo Pan and Kaitai Zhang},
journal= {arXiv preprint arXiv:2603.11665},
year = {2026}
}
备注
ACL 2026 Industry Track