使用大型语言模型将机器结果翻译为人类可读报告
计算机视觉与模式识别
2026-01-01 v1
摘要
人工智能(AI)已经改变了医学影像,计算机视觉(CV)系统在分类和检测任务中达到了最先进的性能。然而,这些系统通常输出结构化的预测结果,使得放射科医生仍需负责将结果转化为完整的叙述性报告。大型语言模型(LLM)(如 GPT-4)的最新进展提供了新的机会,通过从结构化发现生成诊断叙述来弥合这一差距。本研究引入了一个流程,将用于胸部 X 光图像异常检测的 YOLOv5 和 YOLOv8 与一个大型语言模型(LLM)相结合,以生成自然语言的放射学报告。YOLO 模型产生边界框预测和类别标签,然后将其传递给 LLM 以生成描述性发现和临床摘要。我们比较了 YOLOv5 和 YOLOv8 在检测准确率、推理延迟以及生成文本质量(通过与真实报告的余弦相似度衡量)方面的表现。结果显示,AI 与人类报告之间存在很强的语义相似性,而人类评估显示 GPT-4 在清晰度方面表现优异(4.88/5),但在自然书写流畅度方面得分较低(2.81/5),这表明当前系统达到了临床准确性,但在风格上仍可与放射科医生撰写的文本区分开来。
引用
@article{arxiv.2512.24518,
title = {Using Large Language Models To Translate Machine Results To Human Results},
author = {Trishna Niraula and Jonathan Stubblefield},
journal= {arXiv preprint arXiv:2512.24518},
year = {2026}
}
备注
11 pages, 7 figures, 3 tables