从dpMV到双像素的立体知识蒸馏用于光场视频重建
计算机视觉与模式识别
2024-05-21 v1
摘要
双像素包含由焦点模糊产生的视差信息。这一视差信息对从自动驾驶到3D创意写实等众多视觉任务非常有用。然而,直接从双像素估计视差精度较低。本文假设通过隐式或显式地将高精度暗立体知识蒸馏到高效的双像素学生网络,可实现可靠的重建。这种暗知识蒸馏还能缓解立体同步设置和标定成本,同时大幅提高参数和推理时间效率。我们收集了首个且规模最大的三视图双像素视频数据集dpMV,以验证显式暗知识蒸馏假设。我们的方法在严苛的前景-背景分离区域尤其出色,尤其是利用双像素提供的可靠指导。最后,我们展示了dpMV和从教师集团中进行隐式暗知识蒸馏所解锁的非常规用例,用于光场(LF)视频重建。我们的LF视频重建方法目前最快且在时序一致性方面最佳。它在重建保真度方面仍具竞争力,同时提供诸多关键属性,如高参数效率、隐式遮挡处理、零样本跨数据集迁移、在更高空间-角分辨率下的几何一致推理,以及可调基线控制。所有源代码均可在匿名仓库https://github.com/Aryan-Garg获取。
引用
@article{arxiv.2405.11823,
title = {Stereo-Knowledge Distillation from dpMV to Dual Pixels for Light Field Video Reconstruction},
author = {Aryan Garg and Raghav Mallampali and Akshat Joshi and Shrisudhan Govindarajan and Kaushik Mitra},
journal= {arXiv preprint arXiv:2405.11823},
year = {2024}
}
备注
International Conference of Computational Photography (ICCP 2024), 11 pages and 12 figures