Rex-Thinker:通过思维链推理实现具身物体指代
计算机视觉与模式识别
2025-06-05 v1
摘要
物体指代旨在检测图像中与给定自然语言描述匹配的所有物体。我们认为,一个鲁棒的物体指代模型应当是具身的,即其预测应具有可解释性并与视觉内容忠实。具体而言,它应满足两个关键属性:1) 可验证性,通过产生可解释的推理来证明其预测,并将其明确地与视觉证据关联;2) 可信性,当图像中没有物体满足给定表达式时学会拒绝。然而,大多数方法将指代视为直接的边界框预测任务,可解释性有限,且难以拒绝没有匹配物体的表达式。在本工作中,我们提出了Rex-Thinker,将物体指代表述为一个显式的思维链推理任务。给定一个指代表达式,我们首先识别所有与所指物体类别对应的候选物体实例。Rex-Thinker随后对每个候选物体进行逐步推理,以评估其是否匹配给定表达式,然后做出最终预测。为支持这一范式,我们通过在HumanRef数据集上提示GPT-4o构建了一个大规模的思维链风格指代数据集HumanRef-CoT。每条推理轨迹遵循结构化的规划、行动和总结格式,使模型能够学习对物体候选的分解式、可解释推理。然后我们以两个阶段训练Rex-Thinker:一个冷启动监督微调阶段以教授模型如何进行结构化推理,随后是基于GRPO的强化学习以提高准确性和泛化能力。实验表明,我们的方法在领域内评估中同时在精确性和可解释性方面超越了标准基线,同时展示了改进的幻觉输出拒绝能力和在领域外设置中的强泛化性。
引用
@article{arxiv.2506.04034,
title = {Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning},
author = {Qing Jiang and Xingyu Chen and Zhaoyang Zeng and Junzhi Yu and Lei Zhang},
journal= {arXiv preprint arXiv:2506.04034},
year = {2025}
}
备注
homepage: https://rexthinker.github.io/