中文

利用大语言模型支持人类评审者识别有害内容

密码学与安全 2024-06-19 v1

摘要

本文探讨了利用大语言模型(LLMs)自动化或 otherwise辅助人类评审者识别有害内容(包括仇恨言论、骚扰、暴力极端主义及选举虚情报)的可行性。我们使用包含5万条评论的数据集,演示了LLMs在与人类裁决结果比较时可达到90%的准确率。我们探讨了如何最好地利用这些能力,提出了五种集成LLMs与人类评分的设计模式,如预筛选不含违规内容、检测人类评分中的潜在错误,或呈现关键背景以支持人类评分。我们概述了如何使用单个优化提示符支持所有这些设计模式。除了这些合成实验之外,我们分享了在实际审查队列中试点我们的方法后所获结果:人类评审者资源利用效率提升41.5%,在检测违规内容方面的准确率和召回率分别提升9%至11%。

关键词

引用

@article{arxiv.2406.12800,
  title  = {Supporting Human Raters with the Detection of Harmful Content using Large Language Models},
  author = {Kurt Thomas and Patrick Gage Kelley and David Tao and Sarah Meiklejohn and Owen Vallis and Shunwen Tan and Blaž Bratanič and Felipe Tiengo Ferreira and Vijay Kumar Eranti and Elie Bursztein},
  journal= {arXiv preprint arXiv:2406.12800},
  year   = {2024}
}