检测转换器中的不确定性量化:目标级校准与图像级可靠性
计算机视觉与模式识别
2026-04-22 v4 人工智能
摘要
DETR 及其变体已成为目标检测的有前景的体系结构,提供了端到端的预测管道。然而在实际应用中,DETR 生成的预测数量远远超过图像中实际存在的目标数量。这引出一个关键问题:我们可以信任其中哪些预测?这在自动驾驶等安全关键应用中尤为重要。为此,我们提供了关于同一图像中预测在角色和可靠性水平方面的经验和理论证据。我们的分析揭示,DETR 采用一种最优专家策略:每种目标训练一个良好校准的预测,而其余预测则训练抑制其前景置信度以接近零,即使保持准确的定位。我们表明,这一策略是匈牙利匹配的损失最小解,从而从根本上塑造了 DETRs 的输出。虽然选择良好校准的预测是理想选择,但它们在推断时是不可识别的。这意味着任何后处理算法都有可能输出一组混合校准水平的预测。因此,实际部署需要对模型的校准质量和后处理算法的有效性进行联合评估。然而,我们演示了现有指标如平均精度和预期校准误差对于这一任务不够。为此,我们进一步引入了目标级校准误差 (OCE):这种以对象为中心的设计同时惩罚保留被抑制的预测和遗漏的ground truth前景对象,使 OCE 适用于评估模型和识别可靠预测子集的最佳实践。最后,我们提出了一个后验不确定性量化框架,用于预测每个图像的模型准确性。
引用
@article{arxiv.2412.01782,
title = {Uncertainty Quantification in Detection Transformers: Object-Level Calibration and Image-Level Reliability},
author = {Young-Jin Park and Carson Sobolewski and Navid Azizan},
journal= {arXiv preprint arXiv:2412.01782},
year = {2026}
}