Label Anything:一种可解释、高保真且无需提示的标注器
机器人学
2025-02-06 v1 机器学习
摘要
自动驾驶(AD)中基于学习的街景语义理解近来取得了显著进展,但 AD 模型的性能严重依赖于标注训练数据的数量和质量。然而,传统的人工标注成本高昂,难以标注训练鲁棒模型所需的海量数据。为了降低人工标注的成本,我们提出了一种 Label Anything 模型(简称 LAM),作为一种可解释、高保真且无需提示的数据标注器。具体来说,我们首先引入一个预训练的视觉Transformer(ViT)来提取潜在特征。在 ViT 之上,我们提出了一个语义类别适配器(SCA)和一个面向优化的展开算法(OptOU),两者均具有极少量的可训练参数。SCA 旨在融合 ViT 提取的特征,以巩固后续自动标注的基础。OptOU 由多个级联层组成,每层包含一个优化公式,使其输出尽可能接近真实值,通过这种方式,OptOU 表现为可解释的,而非基于学习的黑箱性质。此外,由于 SCA 和 OptOU 的可学习参数量很小,训练它们仅需一张预标注的 RGB 种子图像。大量实验清楚地表明,所提出的 LAM 能够为多个真实世界数据集(即 Camvid、Cityscapes 和 Apolloscapes)以及 CARLA 仿真数据集生成高保真标注(mIoU 几乎达到 100%)。
引用
@article{arxiv.2502.02972,
title = {Label Anything: An Interpretable, High-Fidelity and Prompt-Free Annotator},
author = {Wei-Bin Kou and Guangxu Zhu and Rongguang Ye and Shuai Wang and Ming Tang and Yik-Chung Wu},
journal= {arXiv preprint arXiv:2502.02972},
year = {2025}
}
备注
Accepted by ICRA 2025