中文

扩大粒子碰撞数据分析规模

机器学习 2024-12-11 v2 高能物理 - 实验 数据分析、统计与概率

摘要

数十年来,研究人员一直开发针对不同学科科学挑战的任务特定模型。最近,大型语言模型(LLM)在处理通用任务方面显示出巨大的能力;然而,这些模型在解决现实世界的科学问题时面临困难,尤其是涉及大规模数值数据分析的领域,如实验高能物理。这种限制主要归因于 BPE 分词对数值数据效率不高。本文提出一种任务无关架构 BBT-Neutron,采用二进制分词方法,以便对文本与大规模数值实验数据的混合进行预训练。我们演示了将 BBT-Neutron 应用于喷气机起源识别(Jet Origin Identification, JoI),这是高能物理中一个关键的分类挑战,旨在区分来自不同夸克或胶子的喷气机。我们的结果表明,BBT-Neutron 的性能与最新的任务特定 JoI 模型持平。此外,我们检查了 BBT-Neutron 性能随数据量增长的扩展行为,表明 BBT-Neutron 有望作为粒子物理数据分析的基础模型,并可扩展至广泛的科学计算应用,包括大规模实验、工业制造和空间计算。项目代码可在 https://github.com/supersymmetry-technologies/bbt-neutron 查看。

关键词

引用

@article{arxiv.2412.00129,
  title  = {Scaling Particle Collision Data Analysis},
  author = {Hengkui Wu and Panpan Chi and Yongfeng Zhu and Liujiang Liu and Shuyang Hu and Yuexin Wang and Chen Zhou and Qihao Wang and Yingsi Xin and Bruce Liu and Dahao Liang and Xinglong Jia and Manqi Ruan},
  journal= {arXiv preprint arXiv:2412.00129},
  year   = {2024}
}