中文

面向摄像头-only长尾3D目标检测的语义引导专家蒸馏:SemLT3D

计算机视觉与模式识别 2026-04-21 v1

摘要

摄像头-only 3D 目标检测作为自动驾驶中低成本可扩展的 LiDAR 替代方案已逐渐被关注,但现有方法主要追求整体性能,忽视了真实数据集中严重的长尾不平衡问题。实际情况下,许多稀有但安全关键的类别(如儿童、婴儿车或紧急车辆) severely underrepresented,导致偏置性学习和性能下降。这种挑战因类别间明显的模糊性(例如视觉相似的子类)以及类内显著的多样性(例如外观、尺度、姿态或情境差异巨大的物体)而进一步恶化,这些因素共同阻碍了可靠的长尾识别。为此,本文提出 SemLT3D——一种语义引导专家蒸馏框架,通过语义先验丰富面向稀有类别的表征空间。SemLT3D 包含:(1) 语言引导的混合专家模块,根据语义亲和性将 3D 查询路由到专门的专家,从而更好地分离混淆的类别并针对尾部分布进行专业化;(2) 语义投影蒸馏管道,将 3D 查询与 CLIP 信息的 2D 语义对齐,产生跨不同视觉表现形式更连贯、更具辨识力的特征。虽然受长尾不平衡的驱动,SemLT3D 中的语义结构化学习也提升了面对更广泛外观变化和挑战性边界情况时的鲁棒性,为更可靠的摄像头-only 3D 感知提供了原则性方法。

关键词

引用

@article{arxiv.2604.18476,
  title  = {SemLT3D: Semantic-Guided Expert Distillation for Camera-only Long-Tailed 3D Object Detection},
  author = {Hao Vo and Khoa Vo and Thinh Phan and Ngo Xuan Cuong and Gianfranco Doretto and Hien Nguyen and Anh Nguyen and Ngan Le},
  journal= {arXiv preprint arXiv:2604.18476},
  year   = {2026}
}

备注

CVPR 2026