中文

UoB 在 SemEval-2021 任务 5 上的工作:扩展预训练语言模型以融入任务与领域特定信息用于毒性片段预测

计算与语言 2021-10-11 v1

摘要

毒性在社交媒体中普遍存在,并对在线社区健康构成重大威胁。近期预训练语言模型的引入已在众多 NLP 任务中取得 SOTA 结果,改变了我们处理自然语言处理的方式。然而,预训练的内在特性意味着其不太可能捕获任务特定的统计信息或学习领域特定知识。此外,这些模型的大多数实现通常不采用条件随机场这一用于联合 token 分类的方法。我们表明,这些改进可提升模型在 SemEval-2021 毒性片段检测任务上的表现,达到距顶尖团队 4 个百分点以内的分数。

关键词

引用

@article{arxiv.2110.03730,
  title  = {UoB at SemEval-2021 Task 5: Extending Pre-Trained Language Models to Include Task and Domain-Specific Information for Toxic Span Prediction},
  author = {Erik Yan and Harish Tayyar Madabushi},
  journal= {arXiv preprint arXiv:2110.03730},
  year   = {2021}
}

备注

Published in Proceedings of the 15th International Workshop on Semantic Evaluation (SemEval-2021); Code available at: https://github.com/erikdyan/toxic_span_detection