中文

NordDRG 大型语言模型 AI 基准测试

人工智能 2025-08-21 v3

摘要

大型语言模型(LLMs)正在被试点用于临床编码和决策支持,但目前尚无公开基准针对医院资金层——在该层中,诊断相关分组(DRGs)决定报销。在大多数OECD系统中,DRGs通过受管的分组软件引导数万亿美元医疗支出的相当大份额,使得透明度和可审计性成为首要问题。我们发布了NordDRG-AI-Benchmark,这是首个面向DRG推理的公开、规则完整测试平台。该软件包包括(i)约20张机器可读的NordDRG定义表,以及(ii)捕获治理工作流的专家手册和变更日志模板。它提供了两个测试套件:一个13任务的逻辑基准(代码查找、跨表推理、分组特征、多语言术语以及CC/MCC有效性检查)和一个13任务的分组基准,要求完整的DRG分组器仿真,并在DRG和触发drg_logic.id上采用严格精确匹配评分。轻量级参考代理(LogicAgent、GrouperAgent)支持仅基于产物的评估。在仅基于产物(无网络)设置下,在13个逻辑任务上,GPT-5 Thinking和Opus 4.1得分13/13,o3得分12/13;中端模型(GPT-5 Thinking Mini、o4-mini、GPT-5 Fast)得分6-8/13,其余模型得分5/13或以下。在全部13个任务的分组器仿真中,GPT-5 Thinking解决7/13,o3解决6/13,o4-mini解决3/13;GPT-5 Thinking Mini解决1/13,所有其他测试端点得分0/13。据我们所知,这是首次公开报告LLM部分仿真完整NordDRG分组器逻辑并具有治理级可追溯性的结果。将规则完整的发布与精确匹配任务和开放评分相结合,为医院资金领域中的横向和纵向评估提供了可重复的衡量标准。基准材料可在Github上获取。

关键词

引用

@article{arxiv.2506.13790,
  title  = {The NordDRG AI Benchmark for Large Language Models},
  author = {Tapio Pitkäranta},
  journal= {arXiv preprint arXiv:2506.13790},
  year   = {2025}
}

备注

23 pages, 4 figures