中文

用于快速射电暴检测的通才视觉语言模型:针对专用检测器的零样本基准测试

机器学习 2026-07-08 v1 高能天体物理现象 天体物理仪器与方法

摘要

快速射电暴(FRB)是毫秒级的射电瞬变,其自动检测越来越依赖于高度专业化的深度学习模型。这些检测器实现了卓越的性能,但它们需要大量特定于任务的训练数据集,并且无法在不重新训练的情况下重新定义。在这项工作中,我们评估了小型、开放权重、本地运行的通才视觉语言模型(VLM)是否可以在零样本、仅提示的条件下,在动态频谱中检测FRB,无需微调和标记示例,并返回带有自然语言理由的结构化决策。从包含FRB、结构化射频干扰(RFI)和噪声的3000个模拟L波段动态频谱的受控集合中,我们抽取了一个包含2000个样本的平衡二元基准,并将两个这样的VLM(Gemma 4 2B和4B)与最先进的专用检测器SwinYNet进行了逐样本比较。在默认阈值下,Gemma 4 2B达到了93.65%的准确率,与SwinYNet(92.90%)没有统计学显著差异,同时在结构化RFI上显示出显著更低的误报率(6.4%对25.0%),并且在纯噪声上没有误报。SwinYNet在此基准上保持了完美的概率排名(ROC-AUC为1.0000对0.9482),这是零样本VLM仅通过通用预训练所接近的上限。仅重写提示即可将相同的模型重新配置为在全部3000个频谱上进行FRB/RFI/噪声三分类,它们在没有单个虚假FRB的情况下达到了高达86%的准确率。

关键词

引用

@article{arxiv.2607.07382,
  title  = {Generalist Vision-Language Models for Fast Radio Burst detection: a zero-shot benchmark against a specialized detector},
  author = {Raiff H. Santos and Amilcar R. Queiroz and Tharcisyo S. S. Duarte and K. E. L. de Farias and Rafael A. Batista},
  journal= {arXiv preprint arXiv:2607.07382},
  year   = {2026}
}

备注

24 pages, 4 figures