中文

Lang2Act:通过自兴起语言工具链实现细粒度视觉推理

人工智能 2026-04-10 v2 计算机视觉与模式识别

摘要

视觉检索增强生成(VRAG)通过整合外部视觉文档来增强视觉语言模型(VLM),以解决给定查询。现有 VRAG 框架通常依赖刚性、预定义的外部工具来扩展 VLM 的感知能力,通常通过显式地将视觉感知与后续推理过程分离。然而,这种解耦设计可能导致不必要的视觉信息损失,尤其是在应用裁剪等基于图像的操作时。本文提出了 Lang2Act,通过自兴起的语言工具链实现细粒度视觉感知和推理。Lang2Act 收集自兴起的动作作为语言工具,并利用它们来增强 VLM 的视觉感知能力。为支持此机制,我们设计了一个两阶段强化学习(RL)训练框架。具体而言,第一阶段优化 VLM 以自行探索高质量动作以构建可重用的语言工具箱,第二阶段进一步优化 VLM 以有效利用这些语言工具进行下游推理。实验结果表明,Lang2Act 在显著增强 VLM 的视觉感知能力方面有效,性能提升超过 4%。所有代码和数据均可用 https://github.com/NEUIR/Lang2Act 提供。

关键词

引用

@article{arxiv.2602.13235,
  title  = {Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic Toolchains},
  author = {Yuqi Xiong and Chunyi Peng and Zhipeng Xu and Zhenghao Liu and Zulong Chen and Yukun Yan and Shuo Wang and Yu Gu and Ge Yu},
  journal= {arXiv preprint arXiv:2602.13235},
  year   = {2026}
}