SC-Captioner:通过强化学习实现图像描述的自校正
计算机视觉与模式识别
2025-08-11 v1
摘要
我们提出了SC-Captioner,一个使图像描述模型具备自校正能力的强化学习框架。我们的关键技术在于设计奖励函数以激励准确的描述校正。具体而言,预测描述和参考描述通过场景图解析算法被分解为对象、属性和关系集合。我们计算初始描述和自校正描述集合之间的集合差,以识别添加和移除的元素。这些元素与参考集合进行匹配,为精确的修正计算正确性奖励,并为错误的添加和移除计算错误惩罚,从而形成最终奖励。对于图像描述质量评估,我们提出了一套从CAPTURE指标改进而来的指标,缓解了其精度评估不完整和关系匹配效率低下的问题。此外,我们收集了一个细粒度标注的图像描述数据集RefinedCaps,包含来自COCO数据集的6.5K张多样化图像。实验表明,在大型视觉-语言模型上应用SC-Captioner可以在各种场景下生成更优的图像描述,显著优于直接偏好优化训练策略。
引用
@article{arxiv.2508.06125,
title = {SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning},
author = {Lin Zhang and Xianfang Zeng and Kangcong Li and Gang Yu and Tao Chen},
journal= {arXiv preprint arXiv:2508.06125},
year = {2025}
}
备注
ICCV 2025