语言提示 vs. 图像增强:在雾霾环境下提升目标检测性能的 CLIP 方法
计算机视觉与模式识别
2026-04-14 v1
摘要
在雾霾环境中进行目标检测具有挑战性,因为受损目标几乎不可见,其语义被环境噪声削弱,使得检测器难以识别。常见方法涉及图像增强以提升受弱化的语义,但这些方法受限于增强模块的不稳定性。这篇论文提出了一种新方法,通过采用语言提示来增强受弱化的语义,而无需图像增强。具体而言,我们设计近似互斥(AME)为交叉熵损失提供可信权重,从而实现 CLIP 引导的交叉熵损失(CLIP-CE)。所提供的权重评估目标的语义削弱程度。通过 CLIP-CE 的反向传播,弱化的语义被增强,使受损目标更容易被检测。此外,我们提出了精炼 AME(FAME),基于预测置信度自适应微调 AME 的权重。所提出的 FAME 补偿了 AME 中的不平衡优化。进一步,我们提出 HazyCOCO,一个大型合成雾霾数据集,包含 61258 张图像。实验结果表明,我们的方法实现了最先进的性能。代码和数据集将公开发布。
引用
@article{arxiv.2604.10637,
title = {Language Prompt vs. Image Enhancement: Boosting Object Detection With CLIP in Hazy Environments},
author = {Jian Pang and Bingfeng Zhang and Jin Wang and Baodi Liu and Dapeng Tao and Weifeng Liu},
journal= {arXiv preprint arXiv:2604.10637},
year = {2026}
}