中文

Cisco 在 SemEval-2021 任务 5 的工作:何为毒性?利用 Transformers 从在线评论中抽取多处毒性片段

计算与语言 2021-05-31 v1 人工智能

摘要

社交网络平台通常用于分享积极、建设性与有见地的内容。然而,近来人们常暴露于威胁、身份攻击、仇恨言论、侮辱、淫秽文本、攻击性言论或欺凌等令人反感的内容。现有关于毒性语音检测的工作聚焦于二分类或在一小组类别间区分毒性语音。本文描述了 Cisco 团队为 SemEval-2021 任务 5:毒性片段检测所提出的系统,这是首个聚焦于检测文本中导致其毒性的片段(英文)的共享任务。我们主要通过两种方式处理该问题:序列标注方法与依存解析方法。在序列标注方法中,我们在特定标注方案下标注句中每个 token。我们在该方法中性能最佳的架构也被证明是我们整体性能最佳的架构,F1 得分为 0.6922,从而使我们在最终评估阶段排行榜上位列第 7。我们还探索了一种依存解析方法,在目标片段边界监督下从输入句子抽取片段,并使用双仿射模型对片段排序。最后,我们在文中还提供了对结果与模型性能的详细分析。

关键词

引用

@article{arxiv.2105.13959,
  title  = {Cisco at SemEval-2021 Task 5: What's Toxic?: Leveraging Transformers for Multiple Toxic Span Extraction from Online Comments},
  author = {Sreyan Ghosh and Sonal Kumar},
  journal= {arXiv preprint arXiv:2105.13959},
  year   = {2021}
}

备注

9 pages, accepted at SemEval-2021 co-located with ACL-IJCNLP 2021