FHAC 在 GermEval 2021 上的工作:用集成学习识别德语有毒、引人互动及主张事实的评论
计算与语言
2021-09-08 v1
摘要
由大型预训练神经网络模型(如 BERT 和 ELECTRA)学到的语言表征的可获得性,近年来促成了许多下游自然语言处理任务的改进。预训练模型通常在预训练目标、架构和所训练数据集上有所不同,这会影响下游性能。在本文中,我们微调了德语 BERT 和德语 ELECTRA 模型,以识别 GermEval 2021 竞赛所提供的 Facebook 数据中的有毒评论(子任务 1)、引人互动评论(子任务 2)和主张事实评论(子任务 3)。我们创建了这些模型的集成并研究了分类性能是否及如何依赖于集成成员的数量及其构成。在样本外数据上,我们最佳的集成取得了 0.73 的宏 F1 分数(所有子任务),以及子任务 1、2、3 分别 0.72、0.70 和 0.76 的 F1 分数。
引用
@article{arxiv.2109.03094,
title = {FHAC at GermEval 2021: Identifying German toxic, engaging, and fact-claiming comments with ensemble learning},
author = {Tobias Bornheim and Niklas Grieger and Stephan Bialonski},
journal= {arXiv preprint arXiv:2109.03094},
year = {2021}
}
备注
7 pages, 2 figures