中文

Doduo:从无监督语义感知流学习稠密视觉对应

计算机视觉与模式识别 2023-09-27 v1 人工智能 机器人学

摘要

稠密视觉对应在机器人感知中起着至关重要的作用。本工作致力于建立捕捉经历显著变换的动态场景的一对图像之间的稠密对应。我们提出Doduo,从野外图像和视频中无真实监督地学习通用稠密视觉对应。给定一对图像,它估计编码一幅图像中每个像素到另一幅图像中对应像素位移的稠密流场。Doduo利用基于流的扭曲获取训练的监督信号。将语义先验与自监督流训练相结合,Doduo生成对场景动态变化鲁棒的准确稠密对应。在野外视频数据集上训练后,Doduo在点级对应估计上展现出优于现有自监督对应学习基线的性能。我们还将Doduo应用于关节估计和零样本目标条件操作,凸显其在机器人中的实际应用。代码与额外可视化见 https://ut-austin-rpl.github.io/Doduo

关键词

引用

@article{arxiv.2309.15110,
  title  = {Doduo: Learning Dense Visual Correspondence from Unsupervised Semantic-Aware Flow},
  author = {Zhenyu Jiang and Hanwen Jiang and Yuke Zhu},
  journal= {arXiv preprint arXiv:2309.15110},
  year   = {2023}
}

备注

Project website: https://ut-austin-rpl.github.io/Doduo