中文

微调 Llama 2 大语言模型以检测网络性诱聊与辱骂文本

计算与语言 2023-08-29 v1 人工智能 机器学习

摘要

由于对网络安全的日益关注,尤其是针对儿童和青少年等弱势群体的担忧,检测社交媒体平台上的网络性诱行为(sexual predatory behaviours)和辱骂性语言已成为一个关键的研究领域。研究人员一直在探索各种技术和方法来开发能够有效识别并缓解这些风险的检测系统。大语言模型(LLMs)的最新发展为解决这一问题提供了新机遇。本文提出一种利用 Meta GenAI 近期开源的预训练 Llama 2 7B 参数模型检测网络性诱聊天与辱骂性语言的方法。我们使用不同规模、不平衡程度及语言(即英语、罗马乌尔都语和乌尔都语)的数据集对 LLM 进行微调。基于 LLM 的能力,我们的方法具有通用性和自动化特点,无需像该领域传统方法那样手动寻找特征提取与分类器设计步骤之间的协同。实验结果表明所提方法性能强劲,在五组实验的三个不同数据集上均表现熟练且稳定。本研究结果表明,所提方法可部署于真实应用(即便涉及非英语语言),用于标记网络讨论与评论中的性诱者、攻击性或有毒内容、仇恨言论及歧视性语言,以维护尊重性的互联网或数字社区。此外,它还可用于解决其他潜在应用的文本分类问题,如情感分析、垃圾与钓鱼检测、法律文档排序、假新闻检测、语言识别、用户意图识别、基于文本的产品分类、医疗记录分析及简历筛选。

关键词

引用

@article{arxiv.2308.14683,
  title  = {Fine-Tuning Llama 2 Large Language Models for Detecting Online Sexual Predatory Chats and Abusive Texts},
  author = {Thanh Thi Nguyen and Campbell Wilson and Janis Dalins},
  journal= {arXiv preprint arXiv:2308.14683},
  year   = {2023}
}