中文

BridgeTA:通过教师助理桥接知识蒸馏中的表示差距用于鸟瞰图分割

计算机视觉与模式识别 2026-05-26 v2

摘要

鸟瞰图(BEV)分割是自动驾驶中最重要且最具挑战性的任务之一. 摄像头-only 方法因成本效益而受到关注, 但仍落后于激光雷达-摄像头(LC)融合方法. 知识蒸馏(KD)被探索用于缩小这一差距, 但现有方法主要通过模仿教师的体系结构来扩大学生模型, 导致更高的推理成本. 为了解决这一问题, 我们引入了BridgeTA, 这是一个通过教师助理(TA)网络桥接LC融合和摄像头-only模型之间表示差距的高性价比蒸馏框架, 同时保持学生的体系结构和推理成本不变. 一个轻量级TA网络组合教师和学生的BEV表示, 创建一个共享的潜在空间作为中间表示. 为了在理论上对框架进行 grounding, 我们使用杨氏不等式推导了蒸馏损失, 将直接的教师-学生蒸馏路径分解为教师-TA和TA-学生双重路径, 从而稳定优化并加强知识传递. 在具有挑战性的nuScenes 数据集上的大量实验表明, 我们方法的有效性, 在摄像头-only 基线上实现了4.2%的mIoU提升, 而其他最先进(KD)方法的提升幅度高达45%.

关键词

引用

@article{arxiv.2508.09599,
  title  = {BridgeTA: Bridging the Representation Gap in Knowledge Distillation via Teacher Assistant for Bird's Eye View Map Segmentation},
  author = {Beomjun Kim and Suhan Woo and Sejong Heo and Euntai Kim},
  journal= {arXiv preprint arXiv:2508.09599},
  year   = {2026}
}

备注

Accepted at ICRA 2026 (8 pages, 6 figures)