中文

SegDAC:基于动态对象标记的强化学习视觉泛化

计算机视觉与模式识别 2026-03-16 v4 人工智能 机器学习 机器人学

摘要

在像素观测上训练的视觉强化学习策略,在测试时视觉条件发生变化时往往难以泛化。以对象为中心的表示是一种很有前景的替代方案,但大多数方法使用固定大小的槽表示,需要图像重建,或需要辅助损失来学习对象分解。因此,如何在没有这些约束的情况下直接从对象级输入学习 RL 策略仍不清楚。我们提出了 SegDAC,一种基于分割的 Actor-Critic,作用于可变长度的对象标记嵌入集合。在每个时间步,文本基础分割生成对象掩码,从中提取具有空间感知的标记嵌入。基于 Transformer 的 Actor-Critic 处理这些动态标记,使用分段位置编码来保留跨对象的空间信息。我们消融了这些设计选择,并表明分段位置编码和可变长度处理对于强大的性能都是单独必要的。我们在 3 个难度级别的 12 种视觉扰动类型下的 8 个 ManiSkill3 操作任务上评估了 SegDAC。SegDAC 在简单、中等和最难设置上分别比先前的视觉泛化方法提高了 15%、66% 和 88%。SegDAC 匹配了最先进的视觉 RL 方法的样本效率,同时在视觉变化下实现了更好的泛化。项目页面:https://segdac.github.io/

关键词

引用

@article{arxiv.2508.09325,
  title  = {SegDAC: Visual Generalization in Reinforcement Learning via Dynamic Object Tokens},
  author = {Alexandre Brown and Glen Berseth},
  journal= {arXiv preprint arXiv:2508.09325},
  year   = {2026}
}

备注

12 pages