基于强化学习构建与解释视觉推理的数字孪生表示
计算机视觉与模式识别
2025-11-18 v1
摘要
视觉推理可能需要模型解释图像和视频,并对来自多样化输出格式的隐式文本查询作出响应,从像素级分割掩码到自然语言描述。现有方法依赖于针对特定任务的监督微调。例如,推理分割、定位、摘要和视觉问答各自都需要不同的模型设计和训练,阻碍了统一解决方案的实现,并限制了跨任务和跨模态的泛化。因此,我们提出了 DT-R1,一种基于强化学习的框架,用于训练大语言模型构建复杂多模态视觉输入的数字孪生表示,然后对这些高层表示进行统一推理。具体而言,我们使用 GRPO 训练 DT-R1,采用一种验证结构完整性和输出准确性的新颖奖励函数。评估六个视觉推理基准(覆盖两种模态和四种任务类型)显示,DT-R1 在所有任务上均实现了对最先进任务特定模型的一致性改进。DT-R1 开辟了一条通过数字孪生表示实现视觉推理的新方向。
引用
@article{arxiv.2511.12365,
title = {Constructing and Interpreting Digital Twin Representations for Visual Reasoning via Reinforcement Learning},
author = {Yiqing Shen and Mathias Unberath},
journal= {arXiv preprint arXiv:2511.12365},
year = {2025}
}