中文

基于层次化多示例多标签学习的宣传技巧检测

计算与语言 2023-06-01 v1

摘要

自 SemEval 2020 Task 11 (Martino et al., 2020a) 提出以来,文献中已提出多种基于影响读者的修辞技巧对宣传进行分类的方法。然而,这些方法每次仅对一个片段进行分类,忽略了同一语境下其他片段标签之间的依赖关系。在本文中,我们将宣传技巧分类视为一个多示例多标签 (MIML) 学习问题 (Zhou et al., 2012),并提出了一种简单的基于 RoBERTa 的模型 (Zhuang et al., 2021),用于同时分类一篇文章中的所有片段。此外,我们注意到,由于标注过程中标注者按照决策树对片段进行分类,不同技巧之间存在固有的层次关系,而现有方法忽略了这一点。我们通过为决策树中的每个节点向训练目标添加一个辅助分类器,并在测试时集成原始分类器与辅助分类器的预测结果,来纳入这些层次化标签依赖。总体而言,在交叉验证设置下,我们的模型比共享任务获胜团队的模型在 micro-F1 上绝对提升了 2.47%,并且是共享任务排行榜上性能最佳的非集成模型。

关键词

引用

@article{arxiv.2305.19419,
  title  = {Hierarchical Multi-Instance Multi-Label Learning for Detecting Propaganda Techniques},
  author = {Anni Chen and Bhuwan Dhingra},
  journal= {arXiv preprint arXiv:2305.19419},
  year   = {2023}
}