LENS:用于统一强化推理分割一切的学习方法
计算机视觉与模式识别
2025-11-19 v2 人工智能
摘要
文本驱动的图像分割实现了精细的视觉理解,是人机交互和机器人等应用的关键技术。然而,现有的监督微调方法通常忽略测试时的显式链式思维(CoT)推理,这限制了其对未见提示和领域的泛化能力。为此,我们提出了 LENS,一个可扩展的强化学习框架,端到端地联合优化推理过程和分割。我们提出了涵盖句子、框和分割水平的统一强化学习奖励,鼓励模型在细化掩码质量的同时生成信息丰富的CoT理由。基于公开的 30 亿参数视觉语言模型 Qwen2.5-VL-3B-Instruct,LENS 在 RefCOCO、RefCOCO+ 和 RefCOCOg 数据集上实现了 81.2% 的平均 cIoU,超过强大的微调方法 GLaMM 高出最高 5.6%。这些结果表明,基于 RL 的 CoT 推理显著提升了文本驱动分割,并为更通用的 Segment Anything 模型(SAM)提供了实用的路径。代码已公开于 https://github.com/hustvl/LENS。
引用
@article{arxiv.2508.14153,
title = {LENS: Learning to Segment Anything with Unified Reinforced Reasoning},
author = {Lianghui Zhu and Bin Ouyang and Yuxuan Zhang and Tianheng Cheng and Rui Hu and Haocheng Shen and Longjin Ran and Xiaoxin Chen and Li Yu and Wenyu Liu and Xinggang Wang},
journal= {arXiv preprint arXiv:2508.14153},
year = {2025}
}
备注
Code is released at https://github.com/hustvl/LENS