中文

跨模态视觉-触觉物体感知

机器人学 2026-04-03 v1

摘要

估计物理属性对于安全和高效的自主机器人操作至关重要,尤其是在接触丰富的情境下。在此类情境中,视觉和触觉感知提供关于物体几何形状、姿态、惯性、刚性和接触动力学(如粘滑行为)的互补信息。然而,这些属性只能间接地被观察,且不能总是精确建模(例如,刚性非刚性物体的变形伴随非线性接触摩擦),使得估计问题本质上具有复杂性,要求在动作期间持续利用视觉-触觉感知信息。现有的视觉-触觉感知框架主要强调力的感知融合或静态跨模态对齐,对如何随时间演化的物体属性不确定性和信念仅考虑有限。受启发于人类多感官感知和主动推理,我们提出 Cross-Modal Latent Filter(CMLF),以学习物理物体属性的结构化、因果潜在状态空间。CMLF 支持视觉与触觉之间交叉先验的双向传递,并通过贝叶斯推理过程整合感知证据,该过程随时间演化。真实世界的机器人实验表明,CMLF 在不确定性下提高了潜在物理属性估计的效率和鲁棒性,优于基准方法。除了性能提升,该模型表现出类似于人类的感知耦合现象,包括对跨模态错觉的敏感性以及在学习跨感官关联时相似的轨迹。总体而言,这些结果标志着机器人多感官感知通用、稳健且物理上一致的跨模态集成的重要进展。

关键词

引用

@article{arxiv.2604.02107,
  title  = {HyVGGT-VO: Tightly Coupled Hybrid Dense Visual Odometry with Feed-Forward Models},
  author = {Junxiang Pan and Lipu Zhou and Baojie Chen},
  journal= {arXiv preprint arXiv:2604.02107},
  year   = {2026}
}