C-DiffDet+: 融合全局场景上下文与生成式去噪用于高保真车辆损伤检测
计算机视觉与模式识别
2025-10-28 v4
摘要
车辆损伤评估等挑战性视觉领域的细粒�目标检测,对人类专家来说也提出了巨大的挑战。虽然 DiffusionDet 通过条件扩散 denoising 推动了检测器的前沿进展,但其性能在情境依赖场景中仍受限于局部特征条件。我们通过引入情境感知融合 (CAF),利用跨注意力机制将全局场景上下文与局部候选框特征直接集成,从而解决这一根本性限制。全局情境由独立的专用编码器生成,捕获全面环境信息,使每个目标候选框都能注意到情境级理解。我们的框架显著增强了生成式检测范式,使每个目标候选框都能注意到全面的环境信息。实验结果在 CarDD 数据集上证明,我们的方法优于当前最先进模型,为细粒度领域的情境感知目标检测树立了新的性能基准。
引用
@article{arxiv.2509.00578,
title = {C-DiffDet+: Fusing Global Scene Context with Generative Denoising for High-Fidelity Car Damage Detection},
author = {Abdellah Zakaria Sellam and Ilyes Benaissa and Salah Eddine Bekhouche and Abdenour Hadid and Vito Renó and Cosimo Distante},
journal= {arXiv preprint arXiv:2509.00578},
year = {2025}
}