中文

SEME在SemEval-2024任务2中的表现:比较掩码语言模型和生成语言模型在临床试验自然语言推理中的应用

计算与语言 2024-04-08 v1

摘要

本文描述了我们在SemEval-2024任务2:安全生物医学临床试验自然语言推理中的提交。多证据临床试验数据自然语言推理(NLI4CT)包含一个文本蕴含(TE)任务,专注于评估应用于临床试验报告(CTR)的自然语言推理(NLI)模型的一致性和忠实性。我们测试了两种不同的方法:一种基于微调和集成掩码语言模型,另一种基于使用模板提示大型语言模型,特别是使用思维链和对比思维链。在2-shot设置下提示Flan-T5-large产生了我们最好的系统,达到了0.57的F1分数、0.64的忠实度和0.56的一致性。

关键词

引用

@article{arxiv.2404.03977,
  title  = {SEME at SemEval-2024 Task 2: Comparing Masked and Generative Language Models on Natural Language Inference for Clinical Trials},
  author = {Mathilde Aguiar and Pierre Zweigenbaum and Nona Naderi},
  journal= {arXiv preprint arXiv:2404.03977},
  year   = {2024}
}