句法成分分析能否增强面向关系提取的领域特定预训练 BERT 模型?
计算与语言
2021-12-07 v1 人工智能
机器学习
定量方法
摘要
近来关于关系提取的研究众多。BioCreative VII 的 DrugProt 评测轨道提供了一份人工标注语料库,用于关系提取系统的开发与评估,其中研究化学物质与基因间的相互作用。我们描述了提交中所用的集成系统,该系统通过多数投票结合微调后的 bioBERT、sciBERT 与 const-bioBERT 模型的预测结果。我们专门测试了句法信息对 BERT 关系提取的贡献。我们观察到,向 BERT 中加入基于成分的句法信息提升了精确率,但降低了召回率,因为在训练集中罕见的关系较不可能被融入句法信息的 BERT 模型预测到。我们的代码已在线公开 [https://github.com/Maple177/drugprot-relation-extraction]。
引用
@article{arxiv.2112.02955,
title = {Does constituency analysis enhance domain-specific pre-trained BERT models for relation extraction?},
author = {Anfu Tang and Louise Deléger and Robert Bossy and Pierre Zweigenbaum and Claire Nédellec},
journal= {arXiv preprint arXiv:2112.02955},
year = {2021}
}