中文

RePIC:面向多模态语言模型的强化后训练 personalize 框架

计算机视觉与模式识别 2025-10-13 v4

摘要

近期多模态大语言模型(MLLM)在生成个性化图像描述时常常难以达到高质量训练所需的效果。本 work 发现,这一局限在现有基于后训练的 MLLM personalize 方法中依然存在。具体而言,尽管通过监督微调(SFT)使用大规模 caption 数据进行后调谋,这些模型仍频繁无法在实际场景中生成忠实的描述,例如在多概念图像描述任务中。然而,为此类复杂场景获取大规模高质量 caption 既成本高昂又困难。为此,我们提出一种基于强化学习(RL)的后训练框架。据我们所知,这是首个用于 MLLM 个性化图像描述的 RL-based 方法。我们的方法显著提升了 MLLM 的视觉识别与个性化生成能力, consistently 超越现有基于 SFT 的基线方法,尤其在具有挑战性的多概念图像描述任务中表现突出。项目页面:https://github.com/oyt9306/RePIC

关键词

引用

@article{arxiv.2506.18369,
  title  = {RePIC: Reinforced Post-Training for Personalizing Multi-Modal Language Models},
  author = {Yeongtak Oh and Dohyun Chung and Juhyeon Shin and Sangha Park and Johan Barthelemy and Jisoo Mok and Sungroh Yoon},
  journal= {arXiv preprint arXiv:2506.18369},
  year   = {2025}
}

备注

Accepted to NeurIPS 2025