中文

SemEval-2024 任务 2:临床试验的安全生物医学自然语言推理

计算与语言 2024-04-09 v1 人工智能

摘要

大型语言模型(LLMs)处于NLP成就的前沿,但在处理捷径学习、事实不一致性和对抗性输入的脆弱性方面存在不足。这些缺陷在医疗环境中尤为关键,因为它们可能歪曲实际模型能力。针对这一点,我们提出了SemEval-2024任务2:临床试验的安全生物医学自然语言推理。我们的贡献包括精炼的NLI4CT-P数据集(即临床试验自然语言推理-扰动版),旨在通过干预和因果推理任务挑战LLMs,以及对参与者提交的方法和结果进行全面评估。共有106名参与者注册了该任务,贡献了超过1200个单独提交和25篇系统概述论文。该倡议旨在推进NLI模型在医疗保健中的鲁棒性和适用性,确保在临床决策中提供更安全、更可靠的人工智能辅助。我们期望该任务的数据集、模型和结果能够支持生物医学NLI领域的未来研究。数据集、竞赛排行榜和网站均已公开。

关键词

引用

@article{arxiv.2404.04963,
  title  = {SemEval-2024 Task 2: Safe Biomedical Natural Language Inference for Clinical Trials},
  author = {Mael Jullien and Marco Valentino and André Freitas},
  journal= {arXiv preprint arXiv:2404.04963},
  year   = {2024}
}