有益还是有害?探索大型语言模型在在线诱骗预防中的效能
密码学与安全
2024-03-18 v1 人工智能
计算与语言
摘要
强大的生成式大型语言模型(LLMs)正成为公众中流行的问答系统工具,并被儿童等弱势群体使用。随着儿童越来越多地与这些工具互动,研究人员必须审视LLMs的安全性,特别是对于可能导致严重后果的应用,如在线儿童安全查询。本文探讨了LLMs在在线诱骗预防中的效能,包括通过建议生成来识别和避免诱骗,并通过改变提供的上下文和提示特异性来研究提示设计对模型性能的影响。在反映超过6000次LLM交互的结果中,我们发现没有模型明显适用于在线诱骗预防,观察到行为缺乏一致性,并且存在生成有害答案的可能性,尤其是来自开源模型。我们概述了模型在哪些方面以及如何存在不足,提供了改进建议,并识别出以令人担忧的方式大幅改变模型性能的提示设计,这些发现可用于指导最佳实践使用指南。
引用
@article{arxiv.2403.09795,
title = {Helpful or Harmful? Exploring the Efficacy of Large Language Models for Online Grooming Prevention},
author = {Ellie Prosser and Matthew Edwards},
journal= {arXiv preprint arXiv:2403.09795},
year = {2024}
}