中文

LESA:基于语言封装与语义融合的在线内容通用声明检测

计算与语言 2021-01-29 v1

摘要

声明的概念化是论证挖掘的核心。由于不同数据分布间文本句法与语境的差异,声明的区分十分复杂。另一个紧迫问题是缺乏带标注的非结构化文本用于实验。本文提出 LESA 框架,旨在通过构建一个源无关的通用模型来率先解决前者问题,该模型通过词性与依存嵌入捕获句法特征,并通过微调语言模型捕获语境特征。我们通过标注一个 Twitter 数据集来解决后者问题,该数据集旨在为大规模非结构化数据提供测试基础。实验结果表明,在六个基准声明数据集上,LESA 的域内实验平均比 SOTA 性能提升 3 个 claim-F1 点,通用域实验提升 2 个 claim-F1 点。在我们的数据集上,LESA 的域内实验也比现有基线高出 1 个 claim-F1 点,通用域实验高出 2 个 claim-F1 点。我们还发布了标注阶段整理的全面数据标注指南(现有文献中缺失此部分)。

关键词

引用

@article{arxiv.2101.11891,
  title  = {LESA: Linguistic Encapsulation and Semantic Amalgamation Based Generalised Claim Detection from Online Content},
  author = {Shreya Gupta and Parantak Singh and Megha Sundriyal and Md Shad Akhtar and Tanmoy Chakraborty},
  journal= {arXiv preprint arXiv:2101.11891},
  year   = {2021}
}

备注

9 pages (plus 2 pages of references), 1 figure, 9 tables, accepted at EACL 2021