中文

DyCAF-Net:动态类别感知融合网络

计算机视觉与模式识别 2025-08-06 v1 机器学习

摘要

近期目标检测的进展依赖于具有多尺度融合和注意力机制的模块化架构,但静态融合启发式方法和类别无感注意力机制在遮挡、杂乱和类别不平衡的动态场景中限制了性能。我们引入动态类别感知融合网络(DyCAF-Net),通过三项创新措施解决这些挑战:(1)基于平衡的输入条件颈部通过隐式固定点建模迭代细化多尺度特征;(2)双动态注意力机制通过输入和类别相关线索自适应校准通道和空间响应;(3)类别感知特征适应调制特征以优先处理稀有类别的判别性区域。通过针对YOLOv8及相关架构的全面消融研究,以及与九个最新方法基准的对比,DyCAF-Net在13个多样化基准(包括遮挡严重和长尾数据集)上显著提升了精度、mAP@50和mAP@50-95。该框架保持计算效率(约11.111.1百万参数)和具竞争力的推理速度,而其对尺度方差、语义重叠和类别不平衡的适应性,使其成为医学成像、监视和自动驾驶系统中实用检测任务的稳健解决方案。

关键词

引用

@article{arxiv.2508.03598,
  title  = {DyCAF-Net: Dynamic Class-Aware Fusion Network},
  author = {Md Abrar Jahin and Shahriar Soudeep and M. F. Mridha and Nafiz Fahad and Md. Jakir Hossen},
  journal= {arXiv preprint arXiv:2508.03598},
  year   = {2025}
}

备注

Accepted to IEEE DSAA 2025 (10 pages, 5 figures)