DeepSeek-R1在双语复杂眼科推理中超越Gemini 2.0 Pro、OpenAI o1和o3-mini
计算与语言
2025-02-26 v1 人工智能
性能
摘要
目的:评估DeepSeek-R1和其他三款近期发布的大型语言模型(LLM)在双语复杂眼科病例中的准确性和推理能力。方法:收集130个与诊断(n=39)和管理(n=91)相关的多选题,从中国眼科 senior 专业资格考试中分类为六个主题。这些题目经DeepSeek-R1翻译成英文。在2025年2月15日至2月20日之间,使用默认配置生成DeepSeek-R1、Gemini 2.0 Pro、OpenAI o1和o3-mini的响应。计算正确答案比例,忽略和额外答案视为错误。通过分析推理逻辑和推理错误原因评估推理能力。结果:DeepSeek-R1在中文题目中实现最高整体准确率,为0.862,在英文题目中为0.808。Gemini 2.0 Pro、OpenAI o1和OpenAI o3-mini在中文题目中分别达到0.715、0.685和0.692(与DeepSeek-R1相比P<0.001),在英文题目中分别为0.746(P=0.115)、0.723(P=0.027)和0.577(P<0.001)。DeepSeek-R1在两种语言的题目中五个主题中均取得最高准确率。它在中文管理题目中也表现突出(所有P<0.05)。推理能力分析显示,四个LLM共享类似的推理逻辑。忽略关键正性病史、忽略关键正性体征、误解医学数据和过于激进是最常见的推理错误原因。结论:DeepSeek-R1在双语复杂眼科推理任务中优于其他三款最先进LLM。虽然其临床应用仍存在挑战,但在支持诊断和临床决策方面显示出潜力。
关键词
引用
@article{arxiv.2502.17947,
title = {DeepSeek-R1 Outperforms Gemini 2.0 Pro, OpenAI o1, and o3-mini in Bilingual Complex Ophthalmology Reasoning},
author = {Pusheng Xu and Yue Wu and Kai Jin and Xiaolan Chen and Mingguang He and Danli Shi},
journal= {arXiv preprint arXiv:2502.17947},
year = {2025}
}
备注
29 pages, 4 figures, 1 table