超越问答的医疗 LLM 自动评估
计算与语言
2025-02-21 v1 人工智能
摘要
当前的大型语言模型(LLM)基准测试通常基于开放式或封闭式问答评估,回避了需要人工劳动的要求。封闭式测量评估响应的事实性,但缺乏表达性。开放式方法捕捉模型产生话语响应的能力,但更难评估其正确性。这两种方法常常独立或一起使用,尽管其关系仍不清楚。本工作聚焦于医疗领域,在此领域中事实性和话语性都至关重要。我们引入了一套全面的、多轴医疗 LLM 评估框架,探讨开放和封闭基准及指标之间的相关性。我们的发现包括当前方法中的盲点和重叠。作为一次新的 sanity check,我们发布了一个新的医学基准 --CareQA-- 包含开放和封闭变体。最后,我们提出了一种用于开放式评估的新指标 -- Relax Perplexity -- 以缓解识别出的局限性。
引用
@article{arxiv.2502.06666,
title = {Automatic Evaluation of Healthcare LLMs Beyond Question-Answering},
author = {Anna Arias-Duart and Pablo Agustin Martin-Torres and Daniel Hinjos and Pablo Bernabeu-Perez and Lucia Urcelay Ganzabal and Marta Gonzalez Mallo and Ashwin Kumar Gururajan and Enrique Lopez-Cuena and Sergio Alvarez-Napagao and Dario Garcia-Gasulla},
journal= {arXiv preprint arXiv:2502.06666},
year = {2025}
}