中文

面向机器人操作的身体感知视觉表征学习

机器人学 2026-02-17 v2 计算机视觉与模式识别 机器学习

摘要

学习有效的机器人操作视觉表征仍是基础性挑战,因行动执行中涉及复杂的身体动力学。本文研究如何通过携带身体相关线索的视觉表征来实现下游机器人操作任务的高效策略学习。我们提出了​​**I**nter-token ​​**C**ontrast (​**ICon**),一种应用于视觉Transformer (ViT) 标记级表征的对比学习方法。Icon 通过在特征空间中强化代理特定标记与环境特定标记之间的分离,生成以代理为中心的视觉表征,嵌入身体特定的归纳偏置。该框架可无缝集成到端到端策略学习中,通过将对比损失作为辅助目标 incorporated。我们的实验表明,Icon 不仅提升了跨各种操作任务的策略性能,还促进了不同机器人之间的策略迁移。项目网站: https://inter-token-contrast.github.io/icon/

关键词

引用

@article{arxiv.2505.18487,
  title  = {Grounding Bodily Awareness in Visual Representations for Efficient Policy Learning},
  author = {Junlin Wang and Zhiyun Lin},
  journal= {arXiv preprint arXiv:2505.18487},
  year   = {2026}
}

备注

A preprint version