中文

CMU LTI 在 SemEval-2020 任务 11:融合多层次特征的多粒度宣传片段识别

计算与语言 2020-08-21 v2 信息检索 机器学习

摘要

本文描述了我们针对新闻文章中宣传片段识别任务的提交方案。我们引入了一种基于 BERT-BiLSTM 的片段级宣传分类模型,用于识别句中哪些词元片段具有宣传指示性。该“多粒度”模型在多种文本粒度上融入语言知识,包括词、句与文档层面的句法、语义及语用情感特征,相较于其语言无关变体显著提升了模型性能。为促进更好的表示学习,我们还收集了 10k 篇新闻文章语料,并用于微调模型。最终模型为多数投票集成,通过利用所融入知识的不同子集学习不同的宣传类边界,并在测试排行榜上取得第 4 名。我们的最终模型与代码发布于 https://github.com/sopu/PropagandaSemEval2020。

关键词

引用

@article{arxiv.2008.04820,
  title  = {LTIatCMU at SemEval-2020 Task 11: Incorporating Multi-Level Features for Multi-Granular Propaganda Span Identification},
  author = {Sopan Khosla and Rishabh Joshi and Ritam Dutt and Alan W Black and Yulia Tsvetkov},
  journal= {arXiv preprint arXiv:2008.04820},
  year   = {2020}
}