不止一次剥羊皮:复用多种深度数据集驱动光流学习
计算机视觉与模式识别
2023-10-04 v1
摘要
光流估计对视觉与机器人中的多种应用至关重要。由于在真实场景中收集光流真值难度较大,现有多数光流学习方法仍采用合成数据集进行监督训练,或利用时间相邻视频帧间的光度一致性驱动无监督学习,前者通常存在泛化性问题,而后者性能通常劣于有监督方法。为应对这些挑战,我们提出利用光流估计与立体匹配之间的几何联系(基于跨图像寻找像素对应关系的相似性),统一多种真实世界深度估计数据集以生成光流的有监督训练数据。具体而言,我们通过合成虚拟视差将单目深度数据集转为立体数据集,从而产生水平方向的光流;此外,我们向立体数据引入虚拟相机运动以产生垂直方向的额外光流。进一步地,我们提出对光流对中的一张图像施加几何增强,鼓励光流估计器从更具挑战性的情形中学习。最后,由于不同几何增强下的光流图实际呈现不同特征,我们利用一个辅助分类器从光流图外观识别增强类型,以进一步增强光流估计器的学习。我们提出的方法具有通用性,不依赖于特定光流估计器,基于多种数据集与光流估计模型的大量实验验证了其有效性与优越性。
引用
@article{arxiv.2310.01833,
title = {Skin the sheep not only once: Reusing Various Depth Datasets to Drive the Learning of Optical Flow},
author = {Sheng-Chi Huang and Wei-Chen Chiu},
journal= {arXiv preprint arXiv:2310.01833},
year = {2023}
}