中文

面向医疗记录的人类生成与 AI 生成内容评估的开源工具

人机交互 2025-03-24 v1

摘要

背景:人工智能在医疗文档中的日益广泛应用, necessitates 稳健的方法来评估 AI 生成的医疗记录与人类撰写的医疗记录质量的差异。本文介绍了一个开源工具——Human Notes Evaluator,用于评估临床记录质量并区分人类与 AI 作者。方法:Human Notes Evaluator 是基于 Flask 的 Web 应用程序,部署在 Hugging Face Spaces 上。它采用经验证的 9 项医师文档质量量表(PDQI-9)来评估记录在准确性、完整性、清晰度等维度上的表现。该工具允许用户以 CSV 格式上传临床记录,并针对 PDQI-9 标准对每条记录进行系统性评分,同时评估其作者归属(人类、AI 或不可确定)。结果:Human Notes Evaluator 提供了用于标准化记录评估的用户友好界面,输出包括每项 PDQI-9 评分、作者归属判断以及整体质量指标。可导出的数据促进了人类与 AI 生成记录之间的比较分析、质量趋势识别以及文档改进领域。该工具已在 https://huggingface.co/spaces/iyadsultan/human_evaluator 上线。讨论:该开源工具为研究人员、医疗专业人员和 AI 开发者提供了宝贵资源,利用 PDQI-9 框架,为评估临床文档质量提供结构化且可靠的方法,推动了 AI 在医疗保健领域的负责任融合。该工具在 Hugging Face 的可用性促进了可及性及协作开发。

关键词

引用

@article{arxiv.2503.16504,
  title  = {Open-Source Tool for Evaluating Human-Generated vs. AI-Generated Medical Notes Using the PDQI-9 Framework},
  author = {Iyad Sultan},
  journal= {arXiv preprint arXiv:2503.16504},
  year   = {2025}
}

备注

10 pages, 3 figures