中文

BalCapRL:面向基于 RL 的 MLLM 图像描述生成的平衡框架

计算机视觉与模式识别 2026-05-11 v1 人工智能

摘要

图像描述生成是计算机视觉中最基础的任务之一。鉴于其开放式自然,近年来在多模态大语言模型 (MLLM) 时代受到广泛关注。在追求越来越详尽和准确的描述的过程中,最近的研究越来越倾向于采用强化学习 (RL)。然而,现有的描述生成 RL 方法和评估指标往往只强调狭窄的描述质量概念,导致核心维度之间产生权衡。例如,utility 导向的目标会鼓励产生噪声、幻觉或过长的描述,这些描述虽然改善下游问答效果,却损害流畅性;而类比性评估目标则可能偏好流畅但通用描述,局限于实用性。为此,我们提出一个更平衡的 RL 框架,联合优化 utility-aware 正确性、参考覆盖度和语言质量。为有效优化由此产生的连续多目标奖励函数,我们应用 GDPO 风格的奖励解耦标准化处理连续型描述生成奖励,证明其优于 vanilla GRPO。此外,我们引入长度条件奖励掩码,实现更适用于描述生成的length penalty。我们的方法在 LLaVA-1.5-7B 和 Qwen2.5-VL 3B、7B 基础模型上均取得一致的描述质量提升,峰值提升分别为 +13.6 DCScore、+9.0 CaptionQA 和 +29.0 CapArena。

关键词

引用

@article{arxiv.2605.07394,
  title  = {BalCapRL: A Balanced Framework for RL-Based MLLM Image Captioning},
  author = {Shaokai Ye and Vasileios Saveris and Yihao Qian and Jiaming Hu and Elmira Amirloo and Peter Grasch},
  journal= {arXiv preprint arXiv:2605.07394},
  year   = {2026}
}