中文

BioNLI:利用词汇-语义约束生成对抗样本的生物医学 NLI 数据集

计算与语言 2022-10-27 v1 信息检索 机器学习

摘要

自然语言推理(NLI)对于生物医学领域的复杂决策至关重要。例如,一个关键问题是给定的生物医学机制是否有实验证据支持。这可以被视为一个 NLI 问题,但目前没有可直接使用的数据集来解决它。主要挑战在于,手动为该任务创建信息丰富的负样本既困难又昂贵。我们引入了一种新颖的半监督过程,从现有的生物医学数据集中引导生成 NLI 数据集,该数据集将摘要中的机制与实验证据配对。我们使用九种策略生成一系列负样本,这些策略通过规则(例如翻转交互中实体的角色)以及更重要的是通过神经逻辑解码系统中的逻辑约束扰动来操纵底层机制的结构。我们使用此过程创建了一个名为 BioNLI 的生物医学领域 NLI 新数据集,并对两个最先进的生物医学分类器进行了基准测试。我们获得的最佳结果 F1 值在 70 多分左右,表明了该任务的难度。关键的是,在不同类别的负样本上的表现差异很大,从简单的角色改变负样本的 97% F1 值,到使用神经逻辑解码生成的负样本上几乎不比随机猜测好。

关键词

引用

@article{arxiv.2210.14814,
  title  = {BioNLI: Generating a Biomedical NLI Dataset Using Lexico-semantic Constraints for Adversarial Examples},
  author = {Mohaddeseh Bastan and Mihai Surdeanu and Niranjan Balasubramanian},
  journal= {arXiv preprint arXiv:2210.14814},
  year   = {2022}
}

备注

Accepted to Findings of EMNLP 2022, Data and evaluation suite available at https://stonybrooknlp.github.io/BioNLI/