CoReS:编排推理与分割的舞蹈
计算机视觉与模式识别
2024-07-12 v3
摘要
推理分割任务要求对复杂查询进行细致理解以准确锁定目标区域,正吸引着越来越多的关注。然而,多模态大语言模型(MLLM)往往难以在复杂推理语境中精确定位所描述的物体。我们认为,推理分割的过程应模仿人类视觉搜索的认知阶段,其中每一步都是向最终目标逐步精化的思维过程。因此,我们引入了推理与分割链,并发现这种自顶向下的视觉层级确实增强了视觉搜索过程。具体而言,我们提出了一种双链结构,生成多模态的链式输出来辅助分割过程。此外,为引导 MLLM 的输出进入预期的层级,我们结合上下文输入作为指导。大量实验证明了我们的 CoReS 的卓越性能,在 ReasonSeg 数据集上超越了 SOTA 方法 6.5%。项目页面:https://chain-of-reasoning-and-segmentation.github.io/。
引用
@article{arxiv.2404.05673,
title = {CoReS: Orchestrating the Dance of Reasoning and Segmentation},
author = {Xiaoyi Bao and Siyang Sun and Shuailei Ma and Kecheng Zheng and Yuxin Guo and Guosheng Zhao and Yun Zheng and Xingang Wang},
journal= {arXiv preprint arXiv:2404.05673},
year = {2024}
}
备注
Accepted at ECCV 2024