中文

科学出版物上的全文论证挖掘

计算与语言 2022-10-25 v1

摘要

学术论证挖掘(SAM)近来受到关注,因其有潜力帮助学者应对已发表科学文献的快速增长。它包含两个子任务:论证话语单元识别(ADUR)与论证关系抽取(ARE),二者均具挑战性,因为需要例如领域知识整合、隐式陈述检测以及论证结构消歧。先前工作聚焦于特定文档部分(如摘要或结果)的数据集构建与基线方法,而全文学术论证挖掘进展甚微。本文引入一种结合 ADUR 与 ARE 用于全文 SAM 的序列流水线模型,并首次分析了预训练语言模型(PLMs)在这两个子任务上的表现。我们在 Sci-Arg 语料库上确立了 ADUR 的新 SOTA,大幅超越先前最佳报告结果(+7% F1)。我们也给出了 ARE 以及因此该完整 AM 流水线在此基准数据集上的首批结果。我们的详细错误分析揭示,非连续 ADU 以及话语连接词的释义是主要挑战,且数据标注需更具一致性。

关键词

引用

@article{arxiv.2210.13084,
  title  = {Full-Text Argumentation Mining on Scientific Publications},
  author = {Arne Binder and Bhuvanesh Verma and Leonhard Hennig},
  journal= {arXiv preprint arXiv:2210.13084},
  year   = {2022}
}