从准则到保证:基于图的领域特定 LLM 评估工具包
人工智能
2026-05-18 v3 计算与语言
摘要
对领域特定语言模型进行严谨评估需要具备全面性、抗污染性和可维护性的基准测试。静态的人工 curated 数据集无法满足这些要求。我们提出了一种基于图的评估工具包,将结构化临床准则转化为可查询的知识图谱,通过图遍历动态实例化评估查询。该框架提供三项保证:(1) 完整覆盖准则中的关系;(2) 通过组合变体实现表面形式抗污染;(3) 继承由专家编写的图结构的有效性。应用于 WHO IMCI 准则,该工具包生成覆盖症状识别、治疗、严重程度分类和随访护理的临床依据的多项选择题。评估显示,五种语言模型揭示了系统性的能力缺口。模型在症状识别方面表现良好,但在治疗方案和临床管理决策方面的准确率较低。该框架支持随准则演变持续生成评估数据,并可推广到具有结构化决策逻辑的领域。这为评估基础设施提供了可扩展的支柱。
引用
@article{arxiv.2508.20810,
title = {From Guidelines to Guarantees: A Graph-Based Evaluation Harness for Domain-Specific Evaluation of LLMs},
author = {Jessica M. Lundin and Usman Nasir Nakakana and Guillaume Chabot-Couture},
journal= {arXiv preprint arXiv:2508.20810},
year = {2026}
}