中文

C-DiffDet+: 融合全局场景上下文与生成式去噪用于高保真车辆损伤检测

计算机视觉与模式识别 2025-10-28 v4

摘要

车辆损伤评估等挑战性视觉领域的细粒�目标检测,对人类专家来说也提出了巨大的挑战。虽然 DiffusionDet 通过条件扩散 denoising 推动了检测器的前沿进展,但其性能在情境依赖场景中仍受限于局部特征条件。我们通过引入情境感知融合 (CAF),利用跨注意力机制将全局场景上下文与局部候选框特征直接集成,从而解决这一根本性限制。全局情境由独立的专用编码器生成,捕获全面环境信息,使每个目标候选框都能注意到情境级理解。我们的框架显著增强了生成式检测范式,使每个目标候选框都能注意到全面的环境信息。实验结果在 CarDD 数据集上证明,我们的方法优于当前最先进模型,为细粒度领域的情境感知目标检测树立了新的性能基准。

关键词

引用

@article{arxiv.2509.00578,
  title  = {C-DiffDet+: Fusing Global Scene Context with Generative Denoising for High-Fidelity Car Damage Detection},
  author = {Abdellah Zakaria Sellam and Ilyes Benaissa and Salah Eddine Bekhouche and Abdenour Hadid and Vito Renó and Cosimo Distante},
  journal= {arXiv preprint arXiv:2509.00578},
  year   = {2025}
}