DPVO-QAT++:面向高性能深度块视觉里程计的异构量化感知训练与 CUDA 核融合
计算机视觉与模式识别
2025-11-18 v1
摘要
基于深度学习的视觉 SLAM(vSLAM)系统具备出色的几何推理能力,但其高昂的计算开销严重限制了其在资源受限的自主平台上的部署。本文提出一种分层量化优化框架 DPVO-QAT++。通过可学习尺度参数化、视觉里程计(VO)前后端的异构精度设计(前端采用 FP16/FP32 的浮点伪量化,后端保持全精度)以及面向伪量化的 GPU 原生核融合(自定义 CUDA 核),该框架在保持原始模型轨迹精度的同时,显著降低了内存占用并提升了处理速度。在 TartanAir 数据集上,该框架在 32 个验证序列中实现了平均 FPS 提升 52.1%、中位延迟降低 29.1%、峰值 GPU 显存占用降低 64.9%,且轨迹精度(ATE)与原始 DPVO 模型相当。在 EuRoC 数据集上,该框架在 11 个验证序列中实现了平均 FPS 提升 30.1%、中位延迟降低 23.1%、峰值 GPU 显存占用降低 37.7%,同时保持相当的轨迹精度(ATE)。实验结果表明,DPVO-QAT++ 有效弥合了高精度深度视觉里程计与实际部署效率需求之间的差距,为该技术在真实嵌入式平台上的应用提供了一种可行的工程范式。关键词:视觉里程计、异构精度架构、量化感知训练、CUDA 核融合、仅尺度训练、深度块视觉里程计、GPU 原生核融合。
引用
@article{arxiv.2511.12653,
title = {DPVO-QAT++: Heterogeneous QAT and CUDA Kernel Fusion for High-Performance Deep Patch Visual Odometry},
author = {Cheng Liao},
journal= {arXiv preprint arXiv:2511.12653},
year = {2025}
}