中文

AiSciVision:将大型多模态模型专门化于科学图像分类的框架

机器学习 2024-10-30 v1 人工智能 计算与语言 计算机视觉与模式识别

摘要

信任和可解释性对于在科学研究中使用人工智能(AI)至关重要,但当前模型通常作为黑盒运行,对其输出提供的透明度和理由有限。我们引入了 AiSciVision,这是一个将大型多模态模型专门化为利基科学领域图像分类任务的交互式研究伙伴和分类模型的框架。我们的框架使用两个关键组件:(1)视觉检索增强生成(VisRAG)和(2)在智能体工作流中使用的领域特定工具。为了对目标图像进行分类,AiSciVision 首先检索最相似的正负标记图像作为 LMM 的上下文。然后,LMM 智能体主动选择并应用工具,在多轮中操纵和检查目标图像,在做出最终预测之前完善其分析。这些 VisRAG 和工具组件被设计为模拟领域专家的过程,因为人类通常将新数据与类似示例进行比较,并使用专门工具来操纵和检查图像,然后得出结论。每次推理都会产生一个预测和一份自然语言记录,详细说明导致该预测的推理和工具使用。我们在三个真实世界的科学图像分类数据集上评估了 AiSciVision:检测水产养殖池塘、病态鳗草和太阳能电池板的存在。在这些数据集上,我们的方法在低标注和全标注数据设置下均优于全监督模型。AiSciVision 已在真实世界使用中积极部署,特别是通过一个专门的 Web 应用程序用于水产养殖研究,该应用程序显示记录并允许专家用户与记录进行对话。这项工作代表了朝着既可解释又有效的 AI 系统迈出的关键一步,推进了它们在科学研究和科学发现中的使用。

关键词

引用

@article{arxiv.2410.21480,
  title  = {AiSciVision: A Framework for Specializing Large Multimodal Models in Scientific Image Classification},
  author = {Brendan Hogan and Anmol Kabra and Felipe Siqueira Pacheco and Laura Greenstreet and Joshua Fan and Aaron Ferber and Marta Ummus and Alecsander Brito and Olivia Graham and Lillian Aoki and Drew Harvell and Alex Flecker and Carla Gomes},
  journal= {arXiv preprint arXiv:2410.21480},
  year   = {2024}
}