基于强化学习的场景图编译
计算机视觉与模式识别
2025-05-27 v4
摘要
下一个标记预测是训练大型语言模型(LLM)的基本原则,强化学习(RL)进一步提升了其推理性能。作为有效建模语言、图像、视频及其他模态的方法,LLM 用于从头提取结构化视觉表示(如场景图)仍未得到充分探索。这要求模型准确生成一组对象和关系三元组,而非逐标记生成文本。为实现这一目标,我们引入 R1-SGG,一款通过监督微调(SFT)在场景图数据集上训练,再使用强化学习进行细化的多模态 LLM(M-LLM),以增强其端到端生成场景图的能力。SFT 遵循常规提示-响应范式,而 RL 需要设计有效的奖励信号。我们设计了一组以图为中心的奖励,包括三个基于召回的变体——Hard Recall、Hard Recall+Relax 和 Soft Recall——评估预测与真实值在对象和关系层面的语义和空间对齐程度。格式一致性奖励进一步确保输出遵循预期的结构模式。在 VG150 和 PSG 基准上的大量实验表明,R1-SGG 大幅降低了失败率,在召回和平均召回方面实现了卓越的性能,超越了传统 SGG 模型和现有的多模态语言模型。我们的代码已公开 https://github.com/gpt4vision/R1-SGG。
引用
@article{arxiv.2504.13617,
title = {Compile Scene Graphs with Reinforcement Learning},
author = {Zuyao Chen and Jinlin Wu and Zhen Lei and Marc Pollefeys and Chang Wen Chen},
journal= {arXiv preprint arXiv:2504.13617},
year = {2025}
}