Butter: 面向自动驾驶目标检测的频率一致性与层次化融合
计算机视觉与模式识别
2025-08-01 v2
摘要
层次化特征表示在计算机视觉中发挥着关键作用,尤其是在自动驾驶中的目标检测。多层语义理解对于准确识别行人、车辆和交通标志至关重要。然而,现有架构如YOLO和DETR在不同尺度上维持特征一致性,同时平衡检测精度与计算效率方面存在挑战。为此,我们提出了Butter——一种旨在增强层次化特征表示以提升检测鲁棒性的新型目标检测框架。具体而言,Butter引入两个关键创新:频率自适应特征一致性增强(FACE)组件,通过自适应频率滤波细化多尺度特征一致性,提升结构与边界精度;渐进式层次化特征融合网络(PHFFNet)模块,逐步整合多层次特征,缓解语义间隙,强化层次化特征学习。在BDD100K、KITTI和Cityscapes上的大量实验表明,Butter在特征表示能力方面表现卓越,显著提升检测精度的同时降低模型复杂度。通过聚焦层次化特征细化与融合,Butter为在实际时序自动驾驶场景下实现精度、可部署性与计算效率之间的平衡提供了先进方法。我们的模型和实现已公开于https://github.com/Aveiro-Lin/Butter,促进了自动驾驶社区的进一步研究与验证。
引用
@article{arxiv.2507.13373,
title = {Butter: Frequency Consistency and Hierarchical Fusion for Autonomous Driving Object Detection},
author = {Xiaojian Lin and Wenxin Zhang and Yuchu Jiang and Wangyu Wu and Yiran Guo and Kangxu Wang and Zongzheng Zhang and Guijin Wang and Lei Jin and Hao Zhao},
journal= {arXiv preprint arXiv:2507.13373},
year = {2025}
}
备注
10 pages, 6 figures. Supplementary material: 8 pages, 7 figures. Accepted at ACM Multimedia 2025