RePIC:面向多模态语言模型的强化后训练 personalize 框架
计算机视觉与模式识别
2025-10-13 v4
摘要
近期多模态大语言模型(MLLM)在生成个性化图像描述时常常难以达到高质量训练所需的效果。本 work 发现,这一局限在现有基于后训练的 MLLM personalize 方法中依然存在。具体而言,尽管通过监督微调(SFT)使用大规模 caption 数据进行后调谋,这些模型仍频繁无法在实际场景中生成忠实的描述,例如在多概念图像描述任务中。然而,为此类复杂场景获取大规模高质量 caption 既成本高昂又困难。为此,我们提出一种基于强化学习(RL)的后训练框架。据我们所知,这是首个用于 MLLM 个性化图像描述的 RL-based 方法。我们的方法显著提升了 MLLM 的视觉识别与个性化生成能力, consistently 超越现有基于 SFT 的基线方法,尤其在具有挑战性的多概念图像描述任务中表现突出。项目页面:https://github.com/oyt9306/RePIC
引用
@article{arxiv.2506.18369,
title = {RePIC: Reinforced Post-Training for Personalizing Multi-Modal Language Models},
author = {Yeongtak Oh and Dohyun Chung and Juhyeon Shin and Sangha Park and Johan Barthelemy and Jisoo Mok and Sungroh Yoon},
journal= {arXiv preprint arXiv:2506.18369},
year = {2025}
}
备注
Accepted to NeurIPS 2025