中文

生物医学推文中的主张检测

计算与语言 2021-05-04 v2 社会与信息网络

摘要

社交媒体包含未经过滤且独特的信息,其潜在价值巨大,但在虚假信息的情况下也可能造成巨大危害。就生物医学话题而言,虚假信息可能尤其危险。自动事实核查与假新闻检测方法应对此问题,但尚未应用于社交媒体的生物医学领域。我们旨在填补这一研究空白,并标注了一个包含1200条推文的语料库,用于隐性与显性生物医学主张(后者还带有主张短语的跨度标注)。通过该语料库(我们抽样使其与 COVID-19、麻疹、囊性纤维化和抑郁症相关),我们开发了自动检测含主张推文的基线模型。我们的分析显示,生物医学推文中密集分布着主张(在抽样得到的包含上述提及领域的1200条推文的语料库中占45%)。基于嵌入的分类器与基于 BERT 的迁移学习的基线分类实验表明,该检测具有挑战性,但在识别显性主张表达方面表现出可接受的性能。隐性主张推文更难以检测。

关键词

引用

@article{arxiv.2104.11639,
  title  = {Claim Detection in Biomedical Twitter Posts},
  author = {Amelie Wührl and Roman Klinger},
  journal= {arXiv preprint arXiv:2104.11639},
  year   = {2021}
}

备注

Accepted at the BioNLP Workshop at NAACL 2021