面向真实世界生物医学事实核查的基于实体的声明抽取流水线
计算与语言
2023-04-12 v1
摘要
现有的生物医学声明事实核查模型通常在合成或措辞规范的数据上训练,难以迁移到社交媒体内容。这种不匹配可通过使社交媒体输入模仿常见训练声明的聚焦特性来缓解。为此,Wuehrl & Klinger (2022) 提出基于文本中的医学实体抽取简洁声明。然而,他们的研究有两个局限:第一,它依赖黄金标注实体。因此,其真实世界应用的可行性无法评估,因为这要求自动检测相关实体。第二,他们用原始词元表示声明实体。这构成了术语不匹配,可能限制事实核查性能。为理解这两类挑战,我们提出了一个用于医学推文的声明抽取流水线,其通过实体链接(entity linking)融合了命名实体识别(named entity recognition)与术语规范化。我们表明,与使用黄金标注相比,自动NER确实导致性能下降,但事实核查性能仍相较输入未改动推文有显著提升。然而,将实体规范化到其规范形式并未改善性能。
引用
@article{arxiv.2304.05268,
title = {An Entity-based Claim Extraction Pipeline for Real-world Biomedical Fact-checking},
author = {Amelie Wührl and Lara Grimminger and Roman Klinger},
journal= {arXiv preprint arXiv:2304.05268},
year = {2023}
}
备注
Accepted at The Sixth FEVER Workshop