用于化学-蛋白质相互作用抽取端到端模型:更优分词与基于跨度的流水线策略
计算与语言
2023-04-05 v1
摘要
端到端关系抽取(E2ERE)是信息抽取中的一项重要任务,在科学文献持续指数级增长的生物医学领域尤为如此。E2ERE 通常包含识别实体(或命名实体识别(NER))及关联关系,而多数 RE 任务简单假定实体已预先给出,最终仅执行关系分类。鉴于 NER 错误可能引发 RE 中更多错误的滚雪球效应,E2ERE 本质上难于单独的 RE。生物医学 E2ERE 中的一个复杂数据集是 ChemProt 数据集(BioCreative VI, 2017),其识别科学文献中化合物与基因/蛋白质间关系。ChemProt 已被纳入近期所有生物医学自然语言处理基准,包括 BLUE、BLURB 与 BigBio。然而,除少数例外,这些基准及其他独立工作中对其的处理通常并非端到端。本工作中,我们采用基于跨度的流水线方法,在 ChemProt 数据集上取得了新的最优 E2ERE 性能,较此前最佳结果 F1 分数提升 。结果表明,细粒度分词方案有助于基于跨度的方法在 E2ERE 中表现出色,尤其在处理复杂命名实体时。我们的错误分析还识别了 ChemProt 中 E2ERE 的若干关键失效模式。
引用
@article{arxiv.2304.01344,
title = {End-to-End Models for Chemical-Protein Interaction Extraction: Better Tokenization and Span-Based Pipeline Strategies},
author = {Xuguang Ai and Ramakanth Kavuluru},
journal= {arXiv preprint arXiv:2304.01344},
year = {2023}
}
备注
Accepted to appear in IEEE ICHI 2023 (HealthNLP workshop). Tokenized dataset and code: https://github.com/bionlproc/end-to-end-ChemProt