中文

ChatSchema:基于模式利用大型多模态模型从非结构化数据中提取结构化信息的流程

计算与语言 2024-07-29 v1

摘要

目的:本研究介绍了ChatSchema,一种基于模式(schema)结合大型多模态模型(LMM)和光学字符识别(OCR)从医学论文报告的非结构化数据中提取并结构化信息的方法。通过整合预定义模式,我们旨在使LMM能够直接根据模式规范提取和标准化信息,从而促进后续的数据录入。方法:我们的方法采用两阶段流程,包括分类和提取,用于对报告场景进行分类和信息结构化。我们构建并标注了一个数据集以验证ChatSchema的有效性,并使用精确率、召回率、F1分数和准确率指标评估关键信息提取。基于关键信息提取,我们进一步评估了数值提取。我们对两种LMM进行了消融研究,以说明不同输入模态和方法的贡献。结果:我们分析了来自北京大学第一医院的100份医学报告,并建立了一个包含2,945个键值对的金标准数据集。我们使用GPT-4o和Gemini 1.5 Pro评估了ChatSchema,发现GPT-4o的整体性能更高。结果如下:对于关键信息提取,关键信息精确率为98.6%,召回率为98.5%,F1分数为98.6%。对于基于正确关键信息提取的数值提取,总体准确率为97.2%,精确率为95.8%,召回率为95.8%,F1分数为95.8%。消融研究表明,与基线相比,ChatSchema在键值提取的总体准确率和总体F1分数上分别显著提高了27.4%和26.9%。

关键词

引用

@article{arxiv.2407.18716,
  title  = {ChatSchema: A pipeline of extracting structured information with Large Multimodal Models based on schema},
  author = {Fei Wang and Yuewen Zheng and Qin Li and Jingyi Wu and Pengfei Li and Luxia Zhang},
  journal= {arXiv preprint arXiv:2407.18716},
  year   = {2024}
}