中文

SMc2f:从粗到细的机器人自主性场景矿工

计算机视觉与模式识别 2026-01-21 v1

摘要

自动化机器人车辆的安全性验证依赖于系统atically 测试其规划和控制堆栈中稀有且安全关键场景。从大规模真实驾驶日志中挖掘这些长尾事件是机器人开发生命周期中的关键步骤。场景矿工的目标是检索有用的信息,以启用针对性的重新仿真、回归测试和故障分析,以了解机器人决策算法的行为。RefAV 由 Argoverse 团队提出,是一套使用大语言模型 (LLM) 对场景在自然语言中进行空间和时间局部化的端到端框架。然而,这一过程在轨迹标签上进行检索,忽略了自然语言与原始 RGB 图像之间直接的联系,这与视频检索的直觉相反;还依赖于上游 3D 对象检测和跟踪的质量。进一步地,轨迹数据中的不准确性会导致下游空间和时间局部化中的不准确性。为了解决这些问题,我们提出了 Robust Scenario Mining for Robotic Autonomy from Coarse to Fine (SMc2f),一个粗到细的管道,采用视觉语言模型 (VLM) 进行粗糙图像-文本过滤,在 RefAV 之上构建成功矿工案例的数据库,并自动检索示例以 few-shot 条件化 LLM 以获得更可靠的检索,引入文本-轨迹对比学习以在共享嵌入空间中拉近匹配对并推远不匹配对,从而产生细粒度匹配器以细化 LLM 的候选轨迹。在公开数据集上的实验表明,这在检索质量和效率方面均实现了显著提升。

关键词

引用

@article{arxiv.2601.12010,
  title  = {SMc2f: Robust Scenario Mining for Robotic Autonomy from Coarse to Fine},
  author = {Yifei Chen and Ross Greer},
  journal= {arXiv preprint arXiv:2601.12010},
  year   = {2026}
}