D-NLP于SemEval-2024任务2:评估大语言模型的临床推理能力
计算与语言
2024-05-08 v1
摘要
大型语言模型(LLM)因在各类任务中展现的卓越性能而引起广泛关注和应用。然而,它们也面临诸多挑战,包括幻觉现象、事实性不一致以及在数值-量化推理方面的局限性。评估LLM在多样化推理任务中的表现仍是活跃的研究领域。在LLM突破之前,Transformer技术已在医学领域取得成功,被有效应用于各种自然语言理解(NLU)任务。随着这一趋势,LLM也被训练并应用于医学领域,这引发了关于事实准确性、遵循安全协议以及固有局限性的担忧。本文聚焦于利用临床试验报告作为数据集,评估流行的开源和闭源LLM的自然语言推理能力。我们呈现每个LLM的性能结果,并进一步分析其在开发集上的表现,特别关注那些涉及医学缩写且需要数值-量化推理的具有挑战性的实例。我们的领先LLM——Gemini,在测试集上取得F1分数为0.748,位列任务记分板第九名。我们的工作是首个对LLM在医学领域推理能力进行全面检视的研究。
引用
@article{arxiv.2405.04170,
title = {D-NLP at SemEval-2024 Task 2: Evaluating Clinical Inference Capabilities of Large Language Models},
author = {Duygu Altinok},
journal= {arXiv preprint arXiv:2405.04170},
year = {2024}
}
备注
accepted to SemEval-2024, ranked 9th on Task 2