UTNLP 在 SemEval-2021 任务 5 上的工作:基于注意力、命名实体识别与集成模型的毒性片段检测比较分析
计算与语言
2021-04-13 v1
摘要
检测句子中哪些部分导致了该句子的毒性——而非提供句子层面的仇恨判定——将提升模型的可解释性,并使人工审核者更好地理解系统输出。本文介绍了我们 UTNLP 团队在 SemEval-2021 共享任务 5(毒性片段检测)中的方法与结果。我们测试了多种模型与上下文嵌入,并报告了其中最佳配置。实验从基于关键词的模型开始,随后是基于注意力、基于命名实体、基于 transformers 以及集成模型的实验。我们的最佳方法为一个集成模型,在竞赛评估阶段取得了 0.684 的 F1 值。
引用
@article{arxiv.2104.04770,
title = {UTNLP at SemEval-2021 Task 5: A Comparative Analysis of Toxic Span Detection using Attention-based, Named Entity Recognition, and Ensemble Models},
author = {Alireza Salemi and Nazanin Sabri and Emad Kebriaei and Behnam Bahrak and Azadeh Shakery},
journal= {arXiv preprint arXiv:2104.04770},
year = {2021}
}