注意你的语言: 基于大语言模型的内容审核研究
人机交互
2024-01-18 v2 人工智能
计算与语言
密码学与安全
社会与信息网络
摘要
大语言模型(LLMs)因其在广泛自然语言任务上的执行能力而爆发性流行。基于文本的内容审核是近期备受关注的LLM用例之一,然而,关于LLM在内容审核场景中表现的研究甚少。在本工作中,我们评估了一系列商用LLM在两项常见内容审核任务上的表现:基于规则的社区审核与有毒内容检测。对于基于规则的社区审核,我们通过用95个Reddit子社区的规则提示GPT-3.5,实例化了95个特定子社区LLM。我们发现GPT-3.5对许多社区基于规则的审核是有效的,取得了64%的中位准确率和83%的中位精确率。对于有毒内容检测,我们评估了一系列商用LLM(GPT-3、GPT-3.5、GPT-4、Gemini Pro、LLAMA 2),表明LLM显著优于当前广泛使用的有毒内容分类器。然而,近期模型规模的增大仅为有毒内容检测带来边际收益,暗示LLM在该任务上可能存在性能平台期。我们最后概述了研究LLM与内容审核的未来工作方向。
引用
@article{arxiv.2309.14517,
title = {Watch Your Language: Investigating Content Moderation with Large Language Models},
author = {Deepak Kumar and Yousef AbuHashem and Zakir Durumeric},
journal= {arXiv preprint arXiv:2309.14517},
year = {2024}
}