通过模拟不安全对话来促进线上安全:基于 LLM 的方法
人机交互
2025-07-31 v1 人工智能
摘要
生成式 AI,包括大型语言模型(LLMs),在潜力上——并且已经正在被用于——增加了线上不安全对话的速度、规模和类型。LLMs 降低了恶意行为者创建特定类型不安全对话的进入门槛,正是由于其能够生成具有说服力和人类似的文本的能力。在本工作中,我们探索了通过教育人们了解在有或没有 LLMs 的情况下可能在线上发生的不安全对话,以促进线上安全的方法。我们基于已显示 LLMs 能成功模拟诈骗对话的 prior work。我们还利用学习科学中的研究,表明对假设行为提供反馈可促进学习。特别是,我们专注于使用 LLMs 模拟诈骗对话。我们的工作包含两个 LLMs 进行对话,以模拟用户可能在线上遇到的真实不安全对话,这些对话在诈骗 LLM 和目标 LLM 之间发生,但我们的系统的用户被要求为目标 LLM 提供反馈。
引用
@article{arxiv.2507.22267,
title = {Promoting Online Safety by Simulating Unsafe Conversations with LLMs},
author = {Owen Hoffman and Kangze Peng and Zehua You and Sajid Kamal and Sukrit Venkatagiri},
journal= {arXiv preprint arXiv:2507.22267},
year = {2025}
}