中文

基于验证的多模态实例增强框架:用于长尾3D目标检测的VERIA

计算机视觉与模式识别 2026-03-26 v1

摘要

驾驶数据集中的长尾分布构成3D感知的根本性挑战,因为稀有类别在类别内部呈现显著的多样性,而可用样本仅稀疏地覆盖这种变异空间。现有的基于复制粘贴或资产库的实例增强方法在细粒度多样性和场景语境放置方面往往受限。我们提出VERIA(Verification-Centric Multimodal Instance Augmentation),一种面向长尾3D目标检测的图像优先的多模态增强框架,利用现成基础模型合成同步的RGB--LiDAR实例,并通过顺序语义和几何验证进行筛选。这种以验证为中心的设计倾向于选择更符合真实LiDAR统计特性的实例,并跨越更广泛的类别内部变异范围。阶段性产出分解提供了管道可靠性的基于日志的诊断。在nuScenes和Lyft数据集上,VERIA在LiDAR-only和多模态设置下均提升了稀有类别3D目标检测性能。我们的代码已公开:https://sgvr.kaist.ac.kr/VERIA/。

关键词

引用

@article{arxiv.2603.24294,
  title  = {VERIA: Verification-Centric Multimodal Instance Augmentation for Long-Tailed 3D Object Detection},
  author = {Jumin Lee and Siyeong Lee and Namil Kim and Sung-Eui Yoon},
  journal= {arXiv preprint arXiv:2603.24294},
  year   = {2026}
}