中文

Med-HALT:面向大语言模型的医学领域幻觉测试

计算与语言 2023-10-17 v2 人工智能 机器学习 机器学习

摘要

本研究论文关注大语言模型(LLMs)中幻觉所带来的挑战,尤其在医学领域背景下。幻觉是指这些模型生成看似合理却未经证实或错误的信息,在医疗应用中可能产生严重后果。我们提出了一种新的基准与数据集 Med-HALT(医学领域幻觉测试),专门设计用于评估并减少幻觉。Med-HALT 提供了一个源自多国医学考试的多国多样化数据集,并包含多种创新测试模态。Med-HALT 包括两类测试:推理类与基于记忆的幻觉测试,旨在评估 LLMs 的问题解决与信息检索能力。我们的研究评估了领先的 LLMs,包括 Text Davinci、GPT-3.5、LlaMa-2、MPT 和 Falcon,揭示了它们性能上的显著差异。本文提供了关于该数据集的详细见解,以促进透明性与可复现性。通过本工作,我们旨在为医疗领域更安全、更可靠的语言模型发展做出贡献。我们的基准可在 medhalt.github.io 获取。

关键词

引用

@article{arxiv.2307.15343,
  title  = {Med-HALT: Medical Domain Hallucination Test for Large Language Models},
  author = {Ankit Pal and Logesh Kumar Umapathi and Malaikannan Sankarasubbu},
  journal= {arXiv preprint arXiv:2307.15343},
  year   = {2023}
}

备注

Accepted at EMNLP 2023(The SIGNLL Conference on Computational Natural Language Learning)