AutoMedic:用于临床对话智能体的自动化评估框架,基于医学数据集基准
计算与语言
2025-12-12 v1 机器学习
多智能体系统
摘要
评估大型语言模型(LLM)最近成为在医学领域安全可信地应用的关键性议题。虽然已提出多种静态医学问答(QA)基准,但仍有许多方面未被探索,例如在动态、交互式临床多轮对话情境中,LLM 生成响应的有效性,以及超出简单准确率之外的多维评估策略。然而,由于可能的患者状态和交互轨迹的庞大组合空间,形式化地评估动态、交互式的临床情境受到了制约,难以标准化和定量衡量此类情景。本文引入 AutoMedic,一个多智能体仿真框架,使 LLM 作为临床对话智能体的评估能够自动化。AutoMedic 将即插即用的静态 QA 数据集转换为虚拟患者轮廓,从而在 LLM 智能体之间实现真实且临床上依据的多轮临床对话。随后,依据我们提出的 CARE 指标,对各种临床对话智能体进行评估,该指标提供了临床对话准确性、效率/策略、同理心和鲁棒性等多维评估标准。我们的发现经人类专家验证,表明 AutoMedic 作为临床对话智能体自动化评估框架的有效性,为在对话式医学应用中有效开发 LLM 提供了实用指南。
引用
@article{arxiv.2512.10195,
title = {AutoMedic: An Automated Evaluation Framework for Clinical Conversational Agents with Medical Dataset Grounding},
author = {Gyutaek Oh and Sangjoon Park and Byung-Hoon Kim},
journal= {arXiv preprint arXiv:2512.10195},
year = {2025}
}