中文

即兴网络犯罪隐喻检测

计算与语言 2024-12-04 v2

摘要

检测隐喻对于 various social media 平台的内容安全至关重要,但现有针对隐喻检测的方法在即兴隐喻检测方面效果不佳。本文首次尝试探索即兴隐喻检测,提出了即兴网络犯罪隐喻检测 (Impromptu Cybercrime Euphemisms Detection, ICED) 数据集。此外,我们提出了针对该问题的检测框架,该框架采用上下文增强建模和多轮迭代训练。我们的检测框架主要由粗粒度和细粒度分类模型组成。粗粒度分类模型会删除语料库中大部分无害内容,以待检测。细粒度模型(即兴隐喻检测器)集成了上下文增强和多轮迭代训练,以更好地预测被遮盖 token 的实际含义。此外,我们利用 ChatGPT 来评估该模型的能力。实验结果表明,我们的方法相较于前沿隐喻检测器实现了约 76 倍的显著提升。

关键词

引用

@article{arxiv.2412.01413,
  title  = {Impromptu Cybercrime Euphemism Detection},
  author = {Xiang Li and Yucheng Zhou and Laiping Zhao and Jing Li and Fangming Liu},
  journal= {arXiv preprint arXiv:2412.01413},
  year   = {2024}
}