用于立体匹配的自适应多模态交叉熵损失
计算机视觉与模式识别
2024-03-18 v2
摘要
尽管深度学习在立体匹配中取得巨大成功,恢复精确的视差图仍具挑战。目前,L1与交叉熵是立体网络训练最常用的两种损失。相较前者,后者因其概率建模与对代价体的直接监督通常表现更优。然而,如何为交叉熵损失精确建模立体真值仍鲜有探索。现有工作简单假设真值分布为单模态,忽视了多数边缘像素可为多模态的事实。本文提出一种新颖的自适应多模态交叉熵损失(ADL),引导网络为每个像素学习不同分布模式。此外,我们优化视差估计器以进一步缓解推理中的渗色或错位伪影。大量实验表明,我们的方法具有通用性,可帮助经典立体网络重获最先进性能。特别地,采用本方法的GANet在KITTI 2015与2012基准的已发表方法中均排名第1。同时,仅以我们的损失替代传统损失即可实现优异的从合成到真实的泛化性能。
引用
@article{arxiv.2306.15612,
title = {Adaptive Multi-Modal Cross-Entropy Loss for Stereo Matching},
author = {Peng Xu and Zhiyu Xiang and Chenyu Qiao and Jingyun Fu and Tianyu Pu},
journal= {arXiv preprint arXiv:2306.15612},
year = {2024}
}