中文

面向可解释目标检测与可信 multimodal AI 的 YOLOv10 及 Kolmogorov-Arnold 网络与视觉语言基础模型

计算机视觉与模式识别 2026-03-25 v1 人工智能 计算与语言 机器学习 机器人学

摘要

本文考察了新型Kolmogorov-Arnold网络框架的可解释目标检测能力。该方法指出了自动驾驶感知等计算机视觉领域的一个关键局限性。这些系统对在视觉退化或模糊场景中检测置信度的可靠性缺乏透明度。为此,我们采用Kolmogorov-Arnold网络作为可解释的后置代理,建模You Only Look Once (Yolov10) 检测结果的可信度,使用七个几何和语义特征。Kolmogorov-Arnold网络的可加样条结构使我们能够直接可视化每个特征的影响,产生平滑且透明的函数映射,揭示模型置信度何时得到充分支持,何时不可靠。在Common Objects in Context (COCO) 数据集以及University of Bath校园图片上进行实验,证明该框架准确识别了在模糊、遮挡或低纹理下的低置信预测,为过滤、审核或下游风险缓解提供了可操作性见解。此外,一个引导式语言-图像 (BLIP) 基础模型生成每个场景的描述性标题。该工具实现了轻量级的多模态界面,而不影响可解释性层。最终系统提供可解释的目标检测和可信置信度估计。它为自动驾驶和多模态人工智能应用提供了强大的透明实用感知组件。

关键词

引用

@article{arxiv.2603.23037,
  title  = {YOLOv10 with Kolmogorov-Arnold networks and vision-language foundation models for interpretable object detection and trustworthy multimodal AI in computer vision perception},
  author = {Marios Impraimakis and Daniel Vazquez and Feiyu Zhou},
  journal= {arXiv preprint arXiv:2603.23037},
  year   = {2026}
}

备注

14 pages, 23 Figures, 6 Tables