中文

LTDA-Drive:基于 LLM 的长尾数据增强框架用于自动驾驶

机器人学 2025-05-27 v1

摘要

3D 感知在提高自动驾驶的安全性和性能方面发挥着关键作用。然而,现有模型在训练于自然呈现长尾分布的真实数据集时,往往在稀有且安全关键的脆弱类别(如行人和骑行者)上表现不佳。现有关于重新加权和抽样技术的研究在长尾类别的稀缺性和有限多样性方面存在挑战。为此,我们提出 LTDA-Drive,一种 novel LLM 指导的数据增强框架,用于合成多样化、高质量的长尾样本。LTDA-Drive 通过三个阶段替换驾驶场景中的 head-class 对象为 tail-class 对象:(1) 文本引导的扩散模型移除 head-class 对象,(2) 生成模型插入尾部类别实例,(3) LLM 代理筛选低质量合成图像。在 KITTI 数据集上的实验表明,LTDA-Drive 显著提升了尾部类别检测,稀有类别相较于对手方法提升了 34.75%。这些结果进一步凸显了 LTDA-Drive 在通过生成高质量和多样化数据来解决长尾挑战方面的有效性。

关键词

引用

@article{arxiv.2505.18198,
  title  = {LTDA-Drive: LLMs-guided Generative Models based Long-tail Data Augmentation for Autonomous Driving},
  author = {Mahmut Yurt and Xin Ye and Yunsheng Ma and Jingru Luo and Abhirup Mallik and John Pauly and Burhaneddin Yaman and Liu Ren},
  journal= {arXiv preprint arXiv:2505.18198},
  year   = {2025}
}