中文

基于大语言模型的扫描电子显微镜图像自动尺度栏检测与提取框架

计算机视觉与模式识别 2025-10-14 v1 材料科学 人工智能 数据分析、统计与概率

摘要

扫描电子显微镜 (SEM) 等显微学表征在科学研究中广泛用于可视化和分析微观结构。确定尺度栏是准确 SEM 分析的重要第一步;然而,目前主要依赖手动操作,既耗时又容易出错。为此,我们提出了一个多模态的自动尺度栏检测与提取框架,利用大语言模型 (LLM) 智能体提供对象检测、文本检测和文本识别。该框架包含四个阶段:i) 自动数据生成 (Auto-DG) 模型合成多样化的 SEM 图像,确保模型训练的鲁健性和高泛化性;ii) 尺度栏对象检测;iii) 基于 DenseNet 和卷积循环神经网络 (CRNN) 的混合光学字符识别 (OCR) 系统进行信息提取;iv) LLM 智能体分析并验证结果的准确性。该模型在对象检测和准确定位方面表现突出,分别在 IoU=0.5 时精度为 100%,召回率为 95.8%,平均精度 (mAP) 为 99.2%;在 IoU=0.5:0.95 时 mAP 为 69.1%。混合 OCR 系统在 Auto-DG 数据集上实现 89% 精度、65% 召回率和 75% F1 分数,显著优于多个主流独立引擎,凸显其在科学图像分析中的可靠性。LLM 作为推理引擎和智能助手,提供后续步骤建议并验证结果。该自动化方法显著提升了 SEM 图像尺度栏检测与提取的效率和准确性,为显微分析和科学成像领域提供了有价值的工具。

关键词

引用

@article{arxiv.2510.11260,
  title  = {A Large-Language-Model Assisted Automated Scale Bar Detection and Extraction Framework for Scanning Electron Microscopic Images},
  author = {Yuxuan Chen and Ruotong Yang and Zhengyang Zhang and Mehreen Ahmed and Yanming Wang},
  journal= {arXiv preprint arXiv:2510.11260},
  year   = {2025}
}

备注

14 pages, 6 figures