中文

Mcity数据引擎:通过开放词汇数据选择实现模型迭代改进

计算机视觉与模式识别 2025-07-29 v2

摘要

随着数据可用性的持续增长,为机器学习模型的训练选择并标注合适的样本变得越来越具有挑战性。在大量未标注数据中检测感兴趣的长尾类别尤为困难。这一问题在智能交通系统(ITS)中尤为突出,因为车辆车队与路侧感知系统会产生海量原始数据。尽管工业界存在用于此类迭代数据选择与模型训练流程的专有数据引擎,但研究人员与开源社区仍缺乏一个公开可用的系统。我们提出了Mcity数据引擎,它提供了覆盖完整数据驱动开发周期的模块,从数据采集阶段开始,到模型部署阶段结束。Mcity数据引擎通过开放词汇数据选择流程聚焦于罕见与新颖的类别。所有代码均以MIT许可证在GitHub上公开:https://github.com/mcity/mcity_data_engine

关键词

引用

@article{arxiv.2504.21614,
  title  = {Mcity Data Engine: Iterative Model Improvement Through Open-Vocabulary Data Selection},
  author = {Daniel Bogdoll and Rajanikant Patnaik Ananta and Abeyankar Giridharan and Isabel Moore and Gregory Stevens and Henry X. Liu},
  journal= {arXiv preprint arXiv:2504.21614},
  year   = {2025}
}

备注

Accepted for publication at ITSC 2025