利用大型语言模型检测网络发布的公共威胁的有效性
计算与语言
2025-01-07 v1 人工智能
信息检索
摘要
本文检验了利用大型语言模型(LLM)检测网络发布的公共威胁的有效性。随着对威胁性言论和暴力预警传播的日益担忧,自动化内容分析技术可能有助于早期识别和审核。我们开发了定制数据收集工具,从一个受欢迎的韩国在线社区收集帖子标题,包含 500 个非威胁示例和 20 个威胁示例。我们提示各种 LLM(GPT-3.5、GPT-4、PaLM)将单个帖子分类为“威胁”或“安全”。统计分析发现,所有模型均表现出很高的准确率,在威胁和非威胁识别上均通过了卡方拟合优度检验。GPT-4 整体表现最佳,非威胁准确率为 97.9%,威胁准确率为 100%。可负担性分析还表明 PaLM API 定价具有极高的成本效益。研究结果表明,LLM 可以有效地在大规模上增强人工内容审核,以帮助缓解新出现的网络风险。然而,在现实世界实施之前,偏见、透明度和伦理监督仍然是至关重要的考量因素。
引用
@article{arxiv.2401.02974,
title = {Efficacy of Utilizing Large Language Models to Detect Public Threat Posted Online},
author = {Taeksoo Kwon and Connor Kim},
journal= {arXiv preprint arXiv:2401.02974},
year = {2025}
}
备注
10 pages, 4 figures (1 image figure saved in PNG)