环境AI听写支持:专用AI智能体架构与领先基础模型的性能比较
人工智能
2024-11-12 v1
摘要
本研究将Sporo Health的AI听写器——一种专为医疗听写微调的专有模型——与各种大语言模型(GPT-4o、GPT-3.5、Gemma-9B和Llama-3.2-3B)在临床文档记录中进行了比较。我们分析了合作诊所的去标识化患者转录文本,以临床医生提供的SOAP笔记作为真实标签。每个模型使用零样本提示生成SOAP摘要,性能通过召回率、精确率和F1分数进行评估。Sporo优于所有模型,以最低的性能方差实现了最高的召回率(73.3%)、精确率(78.6%)和F1分数(75.3%)。在Sporo与其他模型之间发现了统计学显著差异(p < 0.05),事后检验显示Sporo在GPT-3.5、Gemma-9B和Llama 3.2-3B上取得了显著提升。虽然Sporo比GPT-4o高出10%,但差异不具有统计学显著性(p = 0.25)。通过修改后的PDQI-9量表测量的临床用户满意度更倾向于Sporo。评估表明Sporo的输出更准确且更相关。这凸显了Sporo的多智能体架构在改善临床工作流程方面的潜力。
引用
@article{arxiv.2411.06713,
title = {Ambient AI Scribing Support: Comparing the Performance of Specialized AI Agentic Architecture to Leading Foundational Models},
author = {Chanseo Lee and Sonu Kumar and Kimon A. Vogt and Sam Meraj},
journal= {arXiv preprint arXiv:2411.06713},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2410.15528