中文

HateTinyLLM:基于小型大型语言模型的仇恨言论检测

计算与语言 2024-05-06 v1 机器学习

摘要

仇恨言论涵盖针对基于敏感特征的个人或群体进行的贬义或歧视性语言的口头、 书面或行为性沟通。自动化仇恨言论检测在遏制其在社交媒体平台上的传播方面发挥着关键作用。各种方法,包括最近在深度学习方面的突破, 都已被用于应对这一挑战。本研究引入 HateTinyLLM, 一种基于微调解码器-only 小型大型语言模型 (tinyLLMs) 构建的新型框架, 用于高效仇恨言论检测。我们的实验结果表明, 经微调的 HateTinyLLM 以显著优于预训练的 mixtral-7b 模型。我们探索了各种小型 LLM, 包括 PY007/TinyLlama-1.1B-step-50K-105b、 Microsoft/phi-2 和 facebook/opt-1.3b, 并使用 LoRA 和 adapter 方法进行微调。我们的观察表明, 所有基于 LoRA 的微调模型均实现了 80% 以上的准确率。

关键词

引用

@article{arxiv.2405.01577,
  title  = {HateTinyLLM : Hate Speech Detection Using Tiny Large Language Models},
  author = {Tanmay Sen and Ansuman Das and Mrinmay Sen},
  journal= {arXiv preprint arXiv:2405.01577},
  year   = {2024}
}