中文

适用于高能物理实验中神极事件分类的视觉语言模型

机器学习 2026-05-14 v4 人工智能 计算机视觉与模式识别 高能物理 - 实验

摘要

近期大语言模型(LLM)的进展表明其在处理和推理超越自然语言的结构化和非结构化数据模式具有非凡能力。本文探索了视觉语言模型(VLM), specifically 是一个经过微调的LLaMA 3.2,用于识别来自高能物理(HEP)实验中像素化探测器数据的神极相互作用。我们将该模型与达到高效能和纯度的状态最先进卷积神经网络(CNN)架构进行基准测试,后者类似于主要神极实验中使用的方式,还有一个视觉Transformer (ViT-h/14),该架构是VLM视觉编码器中的相同架构。我们的评估考虑了分类性能和模型预测的可解释性,比较了VLM与视觉-only变换器(ViT)和卷积神经网络(CNN)基线。我们发现,基于变换器的架构在分类准确率和鲁棒性方面均优于传统CNN,VLM通过集成辅助文本或语义信息提供额外灵活性,并实现更具解释性的推理预测。这些结果凸显了大型变换器模型,特别是视觉语言模型,作为物理事件分类通用 backbone 的潜力,通过结合强性能、鲁棒性和可解释性,为实验神极物理中的多模态推理开辟了新途径。

关键词

引用

@article{arxiv.2509.08461,
  title  = {Adapting Vision-Language Models for Neutrino Event Classification in High-Energy Physics},
  author = {Dikshant Sagar and Kaiwen Yu and Alejandro Yankelevich and Jianming Bian and Pierre Baldi},
  journal= {arXiv preprint arXiv:2509.08461},
  year   = {2026}
}

备注

Accepted for publication in Communications Physics (Nature Portfolio)