AR 眼镜不稳定立体相机系统的高效深度估计
计算机视觉与模式识别
2025-04-30 v2 机器学习
摘要
立体深度估计是增强现实(AR)中的基础组件,需要实时处理以满足低延迟要求。然而,生理学和非 ML 计算(如成本体积)所需的显著延迟往往超过 ML 模型本身的延迟,阻碍了AR所需的实时处理。因此,我们发展了替代性方法来处理生理学和成本体积,考虑到最新硬件(GPU 和 NPUs)的 ML 加速能力。对于预处理,我们通过引入带有生理学位置编码(RPE)的仿射矩阵预测网络来消除其存在,该网络为未经生理学的图像提供低延迟和鲁棒性。对于成本体积,我们用基于组点卷积的算子和基于层归一化和点积的余弦相似度近似取代。基于我们的方法,我们开发了MultiHeadDepth(取代成本体积)和HomoDepth(MultiHeadDepth + 消除预处理)模型。MultiHeadDepth 在准确率上提供了 11.8-30.3% 的改进,在延迟上降低了 22.9-25.2%。HomoDepth 能够直接处理未经生理学的图像,将端到端延迟降低了 44.5%。我们还引入一种多任务学习方法来处理HomoDepth上不对齐的立体输入,通过减少 AbsRel 误差来实现 10.0-24.3% 的改进。总体结果表明,我们的方法在降低推理延迟的同时也提高了模型性能。我们的代码可在 https://github.com/UCI-ISA-Lab/MultiHeadDepth-HomoDepth 获取。
引用
@article{arxiv.2411.10013,
title = {Efficient Depth Estimation for Unstable Stereo Camera Systems on AR Glasses},
author = {Yongfan Liu and Hyoukjun Kwon},
journal= {arXiv preprint arXiv:2411.10013},
year = {2025}
}
备注
12 pages, 11 figures. Accepted to CVPR 2024