中文

利用大语言与视觉模型从大规模图文结肠镜记录中进行知识提取与蒸馏

计算机视觉与模式识别 2023-10-18 v1 人工智能

摘要

用于结肠镜分析的人工智能系统的开发通常需要专家标注的图像数据集。然而,数据集规模与多样性的局限制约了模型性能与泛化能力。来自常规临床实践的图文结肠镜记录包含数百万张图像与文本报告,是有价值的数据源,但其标注工作劳动密集。本文利用大语言与视觉模型的最新进展,提出 EndoKED——一种用于深度知识提取与蒸馏的数据挖掘范式。EndoKED 自动将原始结肠镜记录转化为具有像素级标注的图像数据集。我们使用多中心原始结肠镜记录数据集(约 100 万张图像)验证 EndoKED,证明其在训练息肉检测与分割模型方面具有优越性能。此外,EndoKED 预训练的视觉骨干网络可实现数据高效且可泛化的光学活检学习,在回顾性与前瞻性验证中均达到专家级性能。

关键词

引用

@article{arxiv.2310.11173,
  title  = {Knowledge Extraction and Distillation from Large-Scale Image-Text Colonoscopy Records Leveraging Large Language and Vision Models},
  author = {Shuo Wang and Yan Zhu and Xiaoyuan Luo and Zhiwei Yang and Yizhe Zhang and Peiyao Fu and Manning Wang and Zhijian Song and Quanlin Li and Pinghong Zhou and Yike Guo},
  journal= {arXiv preprint arXiv:2310.11173},
  year   = {2023}
}