面向科学图像解读的多模态深度学习
机器学习
2023-09-27 v2 人工智能
计算工程、金融与科学
计算与语言
计算机视觉与模式识别
摘要
在科学成像领域,解读视觉数据往往需要对主体材料的深刻理解和人类专业知识的精细结合。本研究提出一种新方法,以语言方式模拟并评估类人对扫描电子显微镜(SEM)图像( specifically玻璃材料)的交互。借助多模态深度学习框架,我们的方法从同行评审文章中提取文本与视觉数据中的洞见,并进一步利用GPT-4的精炼数据合成与评估能力。尽管存在细微解读与专业数据集有限等固有挑战,我们的模型(GlassLLaVA)仍擅于对未见过的SEM图像生成准确解读、识别关键特征并检测缺陷。此外,我们引入适用于一系列科学成像应用的通用评估指标,可与基于研究的答案进行基准比对。得益于当代大语言模型(LLM)的鲁棒性,我们的模型能恰当地与论文洞见对齐。这一进展不仅标志着在弥合科学成像中人机解读鸿沟上的显著进步,也暗示了未来研究与更广泛应用拓展的空间。
引用
@article{arxiv.2309.12460,
title = {Multimodal Deep Learning for Scientific Imaging Interpretation},
author = {Abdulelah S. Alshehri and Franklin L. Lee and Shihu Wang},
journal= {arXiv preprint arXiv:2309.12460},
year = {2023}
}