中文

Med-CoDE:基于医学批判的医学LLM不一致性评估框架

信息检索 2025-04-23 v1 人工智能 计算与语言

摘要

大型语言模型 (Large Language Model, LLM) 的兴起显著影响了诸多领域,包括医疗保健,通过增强自动系统处理和生成类人文本的能力。然而,尽管取得了这些进步,LLM 在医疗语境中的可靠性和准确性仍是 critical concerns。当前的评估方法往往缺乏稳健性,无法提供对LLM性能的全面评估,可能在临床环境中引发潜在风险。本文提出了 Med-CoDE,一个专为医学LLM设计的评估框架,以解决这些挑战。该框架利用基于批判的方法,定量衡量模型生成响应与 established medical ground truths 之间的不一致程度。该框架捕捉了医疗环境中的准确性和可靠性。该提议的评估框架旨在填补LLM评估现有空白,为评估医学LLM的质量和可信度提供系统方法。通过大量实验和案例研究,我们展示了该框架在提供医学LLM的全面且可靠评估方面的实际应用性。

关键词

引用

@article{arxiv.2504.15330,
  title  = {Med-CoDE: Medical Critique based Disagreement Evaluation Framework},
  author = {Mohit Gupta and Akiko Aizawa and Rajiv Ratn Shah},
  journal= {arXiv preprint arXiv:2504.15330},
  year   = {2025}
}

备注

8 pages, 4 figures, NAACL SRW 2025