中文

OpenAI o1 在眼科医学中能否推理得当?一项6990题的头对头评估研究

计算与语言 2025-01-27 v1 人工智能

摘要

问题:OpenAI o1 的性能和推理能力如何相较于其他大型语言模型在解答眼科医学专题问题方面?发现:本研究使用6990个来自 MedMCQA 的眼科医学问题,对 OpenAI o1 和五个大型语言模型进行评估。o1 在准确率 (0.88) 和宏平均 F1 分数上取得最高值,但在基于文本生成指标的推理能力排名第三。在子主题中,o1 在“镜头”和“青光眼”中排名第一,但仅次于 GPT-4o 在“角膜和外科疾病”、“眼底和视网膜”以及“眼外科和眼球疾病”中排名第二。亚组分析显示,o1 在答案解释较长的查询中表现更好。意义:o1 的推理增强可能并未完全延伸至眼科医学,这凸显了针对像眼科医学这样的专业领域进行领域特定细化以优化性能的必要性。

关键词

引用

@article{arxiv.2501.13949,
  title  = {Can OpenAI o1 Reason Well in Ophthalmology? A 6,990-Question Head-to-Head Evaluation Study},
  author = {Sahana Srinivasan and Xuguang Ai and Minjie Zou and Ke Zou and Hyunjae Kim and Thaddaeus Wai Soon Lo and Krithi Pushpanathan and Yiming Kong and Anran Li and Maxwell Singer and Kai Jin and Fares Antaki and David Ziyou Chen and Dianbo Liu and Ron A. Adelman and Qingyu Chen and Yih Chung Tham},
  journal= {arXiv preprint arXiv:2501.13949},
  year   = {2025}
}

备注

44 pages