中文

EARL:面向自我中心交互推理与像素定位的统一分析引导强化学习框架

计算机视觉与模式识别 2026-05-15 v1 机器人学

摘要

从自我中心视觉理解人与环境的交互对于辅助机器人和具身智能体至关重要,然而现有的多模态大型语言模型 (MLLMs) 在准确的交互推理和细粒度像素定位方面仍然存在困难。为此,本文介绍了 EARL,一个自我中心分析引导的强化学习框架,该框架将粗略的交互语义显式地转化为面向查询的回答和定位。具体而言,EARL 采用包括粗粒度解释和细粒度响应的两阶段解析框架。第一阶段整体解释自我中心交互并生成结构化的文本描述。第二阶段根据用户查询生成文本答案和像素级掩码。为了连接这两个阶段,我们提取全局交互描述符作为语义先验,并通过新颖的分析引导特征合成器 (AFS) 将其集成以进行面向查询的推理。为了优化包括文本答案、边界框和定位掩码在内的异构输出,我们设计了多方面奖励函数,并使用 GRPO 训练响应阶段。在 Ego-IRGBench 上的实验表明,EARL 在像素定位上实现了 65.48% 的 cIoU,比以前基于 RL 的方法高出 8.37%,而在 EgoHOS 上的 OOD 定位结果表明其对未见过的自我中心定位场景具有很强的可迁移性。

关键词

引用

@article{arxiv.2605.14742,
  title  = {EARL: Towards a Unified Analysis-Guided Reinforcement Learning Framework for Egocentric Interaction Reasoning and Pixel Grounding},
  author = {Yuejiao Su and Xinshen Zhang and Zhen Ye and Lei Yao and Lap-Pui Chau and Yi Wang},
  journal= {arXiv preprint arXiv:2605.14742},
  year   = {2026}
}

备注

Accepted at ICML 2026. Project page: https://github.com/yuggiehk/EARL