中文

评估资源受限环境下大型语言模型在历史健康危机知识中的表现:一种混合多指标研究

计算与语言 2026-03-24 v1 人工智能

摘要

大型语言模型(LLM)在提供健康信息方面具有巨大潜力,但其在低资源环境中的可靠性尚不确定。本研究评估了GPT-4、Gemini Pro、Llama~3和Mistral-7B在疾病传播相关咨询(包括新冠肺炎、登革热、尼帕热病毒和鸟瘟热)在孟加拉国低资源环境中的表现。我们构建了一个来自权威来源的问答数据集,通过语义相似性、专家-模型交叉评估和自然语言推理(NLI)来评估模型输出。研究发现,LLM在表示流行病学历史和健康危机知识方面表现出优势与局限,凸显了其在资源受限环境中为政策制定提供信息的潜力与风险。

关键词

引用

@article{arxiv.2603.20514,
  title  = {Evaluating Large Language Models on Historical Health Crisis Knowledge in Resource-Limited Settings: A Hybrid Multi-Metric Study},
  author = {Mohammed Rakibul Hasan},
  journal= {arXiv preprint arXiv:2603.20514},
  year   = {2026}
}

备注

Comments: 20 pages, 7 figures, 3 tables