中文

大型语言模型提供者文档总结质量工具的开发与验证

人工智能 2025-01-22 v2

摘要

随着大型语言模型(LLM)被集成到电子健康记录(EHR)工作流程中,需要验证的工具对于评估其在实施前的性能至关重要。现有的提供者文档质量工具往往不适用于LLM生成文本的复杂性,且缺乏在真实世界数据上的验证。我们开发了提供者文档总结质量工具(PDSQI-9),用于评估LLM生成的临床摘要。使用GPT-4o、Mixtral 8x7b和Llama 3-8b等多种LLM从多个专业领域的真实EHR数据生成多文档摘要。验证包括对实质性有效性的Pearson相关系数、对结构性有效性的因子分析和Cronbach's alpha、对一般可靠性的ICC和Krippendorff's alpha、对内容有效性的半Delphi过程,以及对高质量摘要与低质量摘要的区分有效性。七位医学专家评估了779个摘要并回答了8329个问题,在提供者可靠性方面实现了80%以上的统计功效。PDSQI-9表现出强大的内部一致性(Cronbach's alpha = 0.879; 95% CI: 0.867-0.891)和高水平的专家间可靠性(ICC = 0.867; 95% CI: 0.867-0.868),支持结构有效性和可扩展性。因子分析识别出4因子模型解释58%的方差,分别代表组织、清晰、准确和实用性。通过摘要长度与Succinct(rho = -0.200, p = 0.029)和Organized(rho = -0.190, p = 0.037)的相关系数支持了实质性有效性。区分有效性将高质量摘要与低质量摘要区分开来(p < 0.001)。PDSQI-9展示出稳健的构建有效性,支持其在临床实践中评估LLM生成的摘要,并促进LLM在医疗保健工作流程中的更安全集成。

关键词

引用

@article{arxiv.2501.08977,
  title  = {Development and Validation of the Provider Documentation Summarization Quality Instrument for Large Language Models},
  author = {Emma Croxford and Yanjun Gao and Nicholas Pellegrino and Karen K. Wong and Graham Wills and Elliot First and Miranda Schnier and Kyle Burton and Cris G. Ebby and Jillian Gorskic and Matthew Kalscheur and Samy Khalil and Marie Pisani and Tyler Rubeor and Peter Stetson and Frank Liao and Cherodeep Goswami and Brian Patterson and Majid Afshar},
  journal= {arXiv preprint arXiv:2501.08977},
  year   = {2025}
}