大型语言模型在消费者健康问题上的实证评估
计算与语言
2025-01-03 v1 人工智能
摘要
本研究评估了几种大型语言模型 (LLM) 在 MedRedQA 上的性能,该数据集包含来自 AskDocs subreddit 中由经验证专家提取的消费者医学问题与答案。尽管 LLMs 在临床问答 (QA) 基准测试中表现出色,但其在现实中、面向消费者的医学问题上的有效性仍不为人知。MedRedQA 提供了独特的挑战,如非正式语言以及需要适合非专业用户的精确回应。为评估模型性能,使用五个 LLM 生成了响应:GPT-4o mini、Llama 3.1: 70B、Mistral-123B、Mistral-7B 和 Gemini-Flash。采用交叉评估方法,其中每个模型都评估其自身响应以及其他模型的响应,以最小化偏见。结果表明,GPT-4o mini 获得了四个中五个模型评委的最高专业水平,而 Mistral-7B 由三个中五个模型评委评为最低。这一研究突显了当前 LLM 在消费者健康医学问答方面的潜力与局限,指出了进一步发展的方向。
引用
@article{arxiv.2501.00208,
title = {An Empirical Evaluation of Large Language Models on Consumer Health Questions},
author = {Moaiz Abrar and Yusuf Sermet and Ibrahim Demir},
journal= {arXiv preprint arXiv:2501.00208},
year = {2025}
}