中文

CCCaption:用于完整且正确图像描述的双奖励强化学习

计算机视觉与模式识别 2026-03-31 v2 人工智能

摘要

图像描述仍是视觉语言理解中的基础任务,但人工注释的参考仍主要依赖人工标注。由于人工注释反映了主观偏好和专业知识,人工注释的描述往往不完整甚至错误,这进而限制了描述模型。我们认为,描述质量应由两个客观方面来评估:完整性(描述是否覆盖所有显著视觉事实?)和正确性(描述是否真实可信?)。为此,我们引入 CCCaption:一个双奖励强化学习框架,配备专门的微调语料库,显式优化这些属性以生成 \textbf{C}omplete and \textbf{C}orrect \textbf{C}aptions。为实现完整性,我们使用多样化的大型语言模型(LVLMs)将图像解构为一组视觉查询,奖励能回答更多查询的描述,并通过动态查询抽样策略提高训练效率。为实现正确性,我们通过验证子描述查询的真实性来惩罚包含幻觉的描述,这些查询来源于描述的分解。我们的对称双奖励优化同时最大化完整性和正确性,引导模型向更满足这些客观标准的描述发展。广泛的实验表明,在标准描述基准上持续实现提升,为超越人工注释模仿的描述模型训练提供了原则方法。

关键词

引用

@article{arxiv.2602.21655,
  title  = {CCCaption: Dual-Reward Reinforcement Learning for Complete and Correct Image Captioning},
  author = {Zhijiang Tang and Linhua Wang and Jiaxin Qi and Weihao Jiang and Peng Hou and Anxiang Zeng and Jianqiang Huang},
  journal= {arXiv preprint arXiv:2602.21655},
  year   = {2026}
}

备注

Accept by CVPR 2026