CMU LTI 在 SemEval-2020 任务 11:融合多层次特征的多粒度宣传片段识别
计算与语言
2020-08-21 v2 信息检索
机器学习
摘要
本文描述了我们针对新闻文章中宣传片段识别任务的提交方案。我们引入了一种基于 BERT-BiLSTM 的片段级宣传分类模型,用于识别句中哪些词元片段具有宣传指示性。该“多粒度”模型在多种文本粒度上融入语言知识,包括词、句与文档层面的句法、语义及语用情感特征,相较于其语言无关变体显著提升了模型性能。为促进更好的表示学习,我们还收集了 10k 篇新闻文章语料,并用于微调模型。最终模型为多数投票集成,通过利用所融入知识的不同子集学习不同的宣传类边界,并在测试排行榜上取得第 4 名。我们的最终模型与代码发布于 https://github.com/sopu/PropagandaSemEval2020。
引用
@article{arxiv.2008.04820,
title = {LTIatCMU at SemEval-2020 Task 11: Incorporating Multi-Level Features for Multi-Granular Propaganda Span Identification},
author = {Sopan Khosla and Rishabh Joshi and Ritam Dutt and Alan W Black and Yulia Tsvetkov},
journal= {arXiv preprint arXiv:2008.04820},
year = {2020}
}