中文

Pixelis:像素空间的推理,从感知到行动

计算机视觉与模式识别 2026-03-27 v1 人工智能

摘要

大多数视觉语言系统是被动的观察者:它们描述像素,不执行行动,也无法在分布迁移时安全地改进。这种被动性限制了可泛化、以物理为基础的视觉智能。通过行动学习,而非静态描述,是超越精选数据集的关键。我们提出 Pixelis,一个直接在图像和视频上运行的像素空间智能体,通过一套紧凑的可执行操作(缩放/裁剪、分割、跟踪、OCR、时间局部化)并从其结果中学习。Pixelis 在三个阶段进行训练:(1)监督微调通过链式思考-动作轨迹学习像素工具语法,采用掩码模仿损失对操作/参数标记加权,并辅助头部以稳定像素 grounding 参数;(2)好奇心-连贯奖励微调优化双驱动目标,将预测误差好奇心与相邻步骤连贯性结合,并在 KL 锚点下施加轻度效率先验,生成短而有效、结构化的工具链;(3)像素测试时 RL 执行无标签适应,通过检索邻居、对完整轨迹而非答案进行投票,并更新以短小、高保真示例为目标,同时通过 KL-to-EMA 安全控制约束漂移。在六个公开图像和视频基准测试中,Pixelis 均实现一致的提升:平均相对提升为 +4.08%(在 VSI-Bench 上峰值达 +6.03%),计算公式为 (ours-baseline)/baseline,同时生成更短、可审计的工具链,并在测试时保持 in-corridor KL。以像素而非抽象标记行动,将多模态感知锚定在物理世界,链接视觉推理与可执行结果,实现无外部反馈的具身适应。

关键词

引用

@article{arxiv.2603.25091,
  title  = {Pixelis: Reasoning in Pixels, from Seeing to Acting},
  author = {Yunpeng Zhou},
  journal= {arXiv preprint arXiv:2603.25091},
  year   = {2026}
}

备注

28pages, 16figures, 18tables