中文

你看见的通常就是你得到的:无需昂贵模态的多模态原型网络

计算机视觉与模式识别 2025-11-26 v1

摘要

物种检测对于监测生态系统健康状况和识别入侵物种至关重要,为指导保育工作提供了关键依据。虽然多模态神经网络日益增多地用于识别物种以帮助自动化此类任务,但它们存在两个主要缺点:其黑箱本质阻碍了其决策过程的可解释性;此外,收集基因数据的成本高昂且需要侵入性操作,往往迫使研究人员必须捕获或杀害目标标本。我们通过扩展原型网络(ProtoPNets),后者是流行且易于解释的传统神经网络备选方案,来解决这两个问题,该网络已扩展至多模态、成本感知的场景。我们对来自每个模态的原型进行集合处理,并使用相关权重来确定给定预测在各模态上的依赖程度。我们进一步引入方法,以识别无需获取昂贵基因信息即可作出确定性预测的情况。我们展示了该方法能够在利用丰富图像数据进行清晰视觉分类的同时,智能分配昂贵的基因数据以进行精细区分,准确率可与持续使用两种模态的模型相当。

关键词

引用

@article{arxiv.2511.19752,
  title  = {What You See is (Usually) What You Get: Multimodal Prototype Networks that Abstain from Expensive Modalities},
  author = {Muchang Bahng and Charlie Berens and Jon Donnelly and Eric Chen and Chaofan Chen and Cynthia Rudin},
  journal= {arXiv preprint arXiv:2511.19752},
  year   = {2025}
}

备注

19 pages. 16 figures. 10 tables