评估ChatGPT在胸部X射线肺炎分类中的性能
计算机视觉与模式识别
2025-10-28 v1 人工智能
摘要
本研究评估了OpenAI gpt-4o模型在无需任何先验微调的情况下,对胸部X射线图像进行NORMAL或PNEUMONIA分类能力。使用平衡的测试集400张图像(每类200张),评估了四种不同的提示设计,从最小指令到详细的、基于推理的提示。结果表明,简洁、聚焦特征的提示实现了最高的74%分类准确率,而基于推理的提示则表现较低。这些发现表明,尽管ChatGPT在医学图像解释方面展现出潜在能力,但其诊断可靠性仍有限。必须在视觉推理和领域特定适应方面取得持续进步,才能使此类模型安全应用于临床实践。
引用
@article{arxiv.2510.21839,
title = {Evaluating ChatGPT's Performance in Classifying Pneumonia from Chest X-Ray Images},
author = {Pragna Prahallad and Pranathi Prahallad},
journal= {arXiv preprint arXiv:2510.21839},
year = {2025}
}