中文

语言模型与第二意见应用案例:口袋专家

密码学与安全 2024-10-29 v1 人工智能

摘要

本研究测试了大型语言模型(LLM)在专业决策中作为正式第二意见工具的作用,特别关注即使是经验丰富的医生也会寻求同行会诊的复杂医疗病例。本工作分析了 Medscape 上 20 个月期间的 183 个挑战性医疗病例,测试了多个 LLM 相对于众包医生回答的表现。一项关键发现是,最新的基础模型可能获得很高的总分(与共识意见相比准确率 >80%),这超过了在相同临床病例(450 页的患者档案和检查结果)上报告的大多数人类指标。该研究评估了 LLM 在简单病例(准确率 >81%)与复杂场景(准确率 43%)之间的表现差异,特别是在这些引发人类医生大量争论的病例中。研究表明,LLM 作为全面鉴别诊断的生成器可能比作为主要诊断工具更有价值,可能有助于抵消临床决策中的认知偏差,减轻认知负荷,从而消除部分医疗错误来源。纳入第二个比较性法律数据集(最高法院案例,N=21)为促进第二意见的 AI 应用提供了额外的实证背景,尽管这些法律挑战对 LLM 来说分析起来要容易得多。除了 LLM 准确性的实证证据这一原创贡献外,本研究还汇总了一个新颖的基准,供他人在 LLM 和意见不一的人类从业者之间评估高度争议问答的可靠性。这些结果表明,LLM 在专业环境中的最佳部署方式可能与当前强调常规任务自动化的方法大相径庭。

关键词

引用

@article{arxiv.2410.20636,
  title  = {Language Models And A Second Opinion Use Case: The Pocket Professional},
  author = {David Noever},
  journal= {arXiv preprint arXiv:2410.20636},
  year   = {2024}
}