中文

PixelThink: 迈向高效的像素链推理

计算机视觉与模式识别 2025-05-30 v1 多媒体

摘要

现有的推理分割方法通常使用图像-文本对和相应的掩码标签来微调多模态大语言模型 (MLLM)。然而,在没有显式推理过程的情况下,它们对分布外场景的泛化能力有限。尽管最近的研究利用强化学习通过组相对策略优化 (GRPO) 来增强推理能力,但它们经常遭受过度思考的困扰——无论任务复杂度如何,都产生冗长统一的推理链。这导致了计算成本升高且对推理质量缺乏控制。为了解决这个问题,我们提出了 PixelThink,一种简单而有效的方案,它集成了外部估计的任务难度和内部测量的模型不确定性,以在强化学习范式中调节推理生成。模型学习根据场景复杂度和预测置信度来压缩推理长度。为了支持全面评估,我们引入了 ReasonSeg-Diff,一个带有标注推理参考和难度分数的扩展基准,以及一套旨在联合评估分割精度、推理质量和效率的指标。实验结果表明,所提出的方法同时提高了推理效率和整体分割性能。我们的工作为高效且可解释的多模态理解提供了新的视角。代码和模型将公开发布。

关键词

引用

@article{arxiv.2505.23727,
  title  = {PixelThink: Towards Efficient Chain-of-Pixel Reasoning},
  author = {Song Wang and Gongfan Fang and Lingdong Kong and Xiangtai Li and Jianyun Xu and Sheng Yang and Qiang Li and Jianke Zhu and Xinchao Wang},
  journal= {arXiv preprint arXiv:2505.23727},
  year   = {2025}
}

备注

Project Page: https://PixelThink.github.io