中文

从大规模偶然型人类数据学习非马尔可夫主动感知策略

机器人学 2026-02-05 v1

摘要

实现对不受约束环境中通用操控的鲁棒性,要求机器人主动解决信息不确定性,即主动感知能力。然而,现有方法常局限于有限类型的感知行为,限制了其在复杂环境中的适用性。本文将主动感知 formalize 为由信息增益和决策分支驱动的非马尔可夫过程,提供了视觉主动感知范式的结构化分类。基于此视角,我们引入 CoMe-VLA,一个认知和记忆感知的视觉-语言-动作(VLA)框架,利用大规模人类偶然型数据学习通用探索和操控先验。我们的框架集成了一个认知辅助头,用于自主子任务转换,以及双轨记忆系统,通过融合本体感知和视觉时间上下文来维持一致的自我和环境意识。通过将人类和机器人手眼协调行为在统一的偶然型动作空间中对齐,我们在三个阶段逐步训练该模型。广泛的在轮式人类机器人上的实验表明,我们提出的方法在跨越多种主动感知情景的各种长期任务上展现出强大的鲁棒性和适应性。

关键词

引用

@article{arxiv.2602.04600,
  title  = {Act, Sense, Act: Learning Non-Markovian Active Perception Strategies from Large-Scale Egocentric Human Data},
  author = {Jialiang Li and Yi Qiao and Yunhan Guo and Changwen Chen and Wenzhao Lian},
  journal= {arXiv preprint arXiv:2602.04600},
  year   = {2026}
}