中文

基于视觉基础模型的汽车内饰可扩展目标检测

计算机视觉与模式识别 2026-05-14 v3

摘要

汽车内饰中的AI任务,如识别和定位外部引入的对象,对个人助理的响应质量至关重要。然而,车载系统的计算资源仍然高度受限,限制了此类解决方案直接在车辆内部的部署。为解决这一限制,我们提出了新颖的车内场景理解目标检测与定位(ODAL)框架。我们的方法通过分布式架构利用视觉基础模型,在车载和云端之间分配计算任务。该设计克服了直接在车内运行基础模型的资源限制。为基准测试模型性能,我们引入了ODALbench,一个用于综合评估检测与定位的新指标。我们的分析证明了该框架在该领域建立新标准的潜力。我们将最先进的GPT-4o视觉基础模型与轻量级LLaVA 1.5 7B模型进行了比较,并探讨了微调如何增强轻量级模型的性能。值得注意的是,我们微调的ODAL-LLaVA模型实现了89%的ODAL分数,相比基线性能提升了71%,并以近20%的优势超越了GPT-4o。此外,微调模型在保持高检测精度的同时显著减少了幻觉,其ODAL信噪比是GPT-4o的三倍。

关键词

引用

@article{arxiv.2508.19651,
  title  = {Scalable Object Detection in the Car Interior With Vision Foundation Models},
  author = {Sebastian Schmidt and Bálint Mészáros and Ahmet Firintepe and Stephan Günnemann},
  journal= {arXiv preprint arXiv:2508.19651},
  year   = {2026}
}