中文

显见之下的隐秘:社交媒体上的误导性关键词与隐性辱骂性语言

计算与语言 2022-05-04 v1 社会与信息网络

摘要

尽管社交媒体提供了自我表达的自由,但辱骂性语言带来了显著的负面社会影响。鉴于该问题的重要性,辱骂性语言自动检测的研究已有所增长和改进。然而,这些检测模型表现出对强烈指示性关键词(如贬损语和脏话)的依赖。这意味着它们可能错误地(1a)漏检不含此类关键词的辱骂内容,或(1b)将含此类关键词的非辱骂内容标记为辱骂,并且(2)它们在未见数据上表现不佳。尽管学界已认识到这些问题,文献中仍存在空白与不一致之处。在本研究中,我们详细分析了从数据集构建到模型行为中关键词的影响,重点关注模型如何在(1a)和(1b)上犯错,以及(1a)和(1b)如何与(2)相互作用。通过该分析,我们为未来研究解决全部三个问题提供了建议。

关键词

引用

@article{arxiv.2205.01374,
  title  = {Hidden behind the obvious: misleading keywords and implicitly abusive language on social media},
  author = {Wenjie Yin and Arkaitz Zubiaga},
  journal= {arXiv preprint arXiv:2205.01374},
  year   = {2022}
}

备注

Accepted for publication in Online Social Networks and Media