图像描述中的群体相对策略优化
计算机视觉与模式识别
2025-03-04 v1
摘要
图像描述任务通常采用两阶段训练来完成模型优化。第一阶段使用交叉熵作为损失函数进行优化,第二阶段使用自关键序列训练(SCST)进行强化学习优化。然而,SCST 算法存在一些缺陷。SCST 仅依赖单个贪心解码结果作为基线。如果模型本身不够稳定,贪心解码结果可能相对较差,这会导致优势估计的方差较大,进而导致策略更新不稳定。此外,SCST 只将一个抽样结果与贪心解码结果进行比较,生成多样性有限,可能陷入局部最优。在本文中,我们提出使用最新的群体相对策略优化(GRPO)强化学习算法作为第二阶段的优化解决方案。GRPO 为输入图像生成多个候选描述,然后通过组内比较持续优化模型。通过约束策略更新的幅度和 KL 散度,大大保证了模型在训练期间的稳定性。此外,与仅抽样一个答案的 SCST 不同,GRPO 抽样并生成多个答案。组内多个候选答案覆盖更广的解空间。结合 KL 散度约束,GRPO 在确保模型稳定性的同时还能提高生成的多样性。本文的代码可在 https://github.com/liangxu-one/ms-models/tree/image_caption_grpo/research/arxiv_papers/Image_Caption_GRPO 获取。
引用
@article{arxiv.2503.01333,
title = {Group Relative Policy Optimization for Image Captioning},
author = {Xu Liang},
journal= {arXiv preprint arXiv:2503.01333},
year = {2025}
}