中文

ZeroFlow:通过蒸馏实现可扩展的场景流估计

计算机视觉与模式识别 2024-03-15 v8 机器学习

摘要

场景流估计是描述时间上连续的逐帧点云之间三维运动场的一项任务。当前最先进的方法使用强先验和测试时优化技术,但处理全尺寸点云需要数十秒量级的时间,使其无法作为实时应用(如开放世界目标检测)的计算机视觉基元使用。前馈方法速度快得多,处理全尺寸点云仅需数十至数百毫秒量级,但需要昂贵的人工监督。为同时解决这两类局限,我们提出“通过蒸馏实现场景流估计”(Scene Flow via Distillation),一个简单、可扩展的蒸馏框架,其使用无标签优化方法生成伪标签以监督前馈模型。我们对该框架的实例化 ZeroFlow,在 Argoverse 2 自监督场景流挑战赛上取得了最先进的性能,且通过在大规模多样化无标签数据上简单训练即实现了零人工标签使用。在测试时,ZeroFlow 在全尺寸点云上比无标签的基于优化的最先进方法快 1000 倍以上(34 FPS 对比 0.028 FPS),并且在无标签数据上训练的成本比人工标注成本低 1000 倍以上(394 美元对比约 750,000 美元)。为促进进一步研究,我们在 https://vedder.io/zeroflow.html 发布了我们的代码、训练好的模型权重,以及针对 Argoverse 2 和 Waymo Open 数据集的高质量伪标签。

关键词

引用

@article{arxiv.2305.10424,
  title  = {ZeroFlow: Scalable Scene Flow via Distillation},
  author = {Kyle Vedder and Neehar Peri and Nathaniel Chodosh and Ishan Khatri and Eric Eaton and Dinesh Jayaraman and Yang Liu and Deva Ramanan and James Hays},
  journal= {arXiv preprint arXiv:2305.10424},
  year   = {2024}
}

备注

Accepted to ICLR 2024. 9 pages, 4 pages of citations, 6 pages of Supplemental. Project page with data releases is at http://vedder.io/zeroflow.html