用于可靠评估医疗对话系统的自动化评分标准
计算与语言
2026-05-14 v2 人工智能
摘要
大型语言模型 (LLM) 越来越多地用于临床决策支持,其中幻觉和不安全的建议可能对患者安全构成直接风险。这些风险难以评估:通用指标和使用通用标准的 LLM 评判者通常会忽略微妙的临床错误,而专家编写的细粒度评分标准既昂贵又难以扩展。在本文中,我们提出了一个检索增强多智能体框架,旨在自动化生成特定于实例的评估评分标准。我们的方法通过将检索到的内容分解为原子事实,并将其与用户交互约束综合以形成可验证的、细粒度的评估标准,从而将评估建立在权威医学证据之上。在 HealthBench 和 LLMEval-Med 数据集上进行评估,我们的框架实现了 50.20% 和 31.90% 的临床意图对齐 (CIA) 分数,显著优于 GPT-4o 基线,并展示了强大的跨语言泛化能力。在 HealthBench 的判别性测试中,我们的评分标准比 GPT-4o 基线高出 7.8% 的胜率,且分数 几乎翻倍,而消融研究证实了其结构必要性。除了评估之外,我们的评分标准还能有效指导响应优化,将质量提高了 9.2%。这为评估和改进医疗 LLM 提供了一个可扩展的跨语言基础。代码可在 https://github.com/AmbeChen/Automated-Rubric-Generation 获取。
引用
@article{arxiv.2601.15161,
title = {Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems},
author = {Yinzhu Chen and Abdine Maiga and Hossein A. Rahmani and Emine Yilmaz},
journal= {arXiv preprint arXiv:2601.15161},
year = {2026}
}