中文

迈向更安全的聊天机器人:定制GPT的自动化策略合规性评估

计算与语言 2025-12-22 v3 人工智能

摘要

基于大型语言模型构建的用户配置聊天机器人,正越来越多地通过集中式市场(如OpenAI的GPT Store)提供。尽管这些平台执行旨在防止有害或不当行为的使用策略,但定制聊天机器人的规模和黑箱特性使得系统性的策略执行变得困难。因此,尽管存在审查流程,违反策略的聊天机器人仍然可以公开访问。本文提出了一种全自动方法,通过黑盒交互评估定制GPT对其市场使用策略的合规性。该方法结合了大规模GPT发现、策略驱动的红队提示以及使用LLM-as-a-judge的自动化合规性评估。我们重点关注OpenAI使用策略中明确涉及的三个策略相关领域:浪漫关系、网络安全和学术类GPT。我们根据人工标注的真实数据集验证了合规性评估组件,在二分类策略违规检测中取得了0.975的F1分数。随后,我们将该方法应用于一项大规模实证研究,评估了从GPT Store检索到的782个定制GPT。结果显示,58.7%的被评估GPT至少产生了一次违规响应,且不同策略领域间存在显著差异。与基础模型(GPT-4和GPT-4o)的比较表明,大多数违规行为源于模型层面的行为,而定制化倾向于放大这些倾向,而非创造新的失效模式。我们的发现揭示了当前用户配置聊天机器人审查机制的局限性,并证明了可扩展的、基于行为的策略合规性评估的可行性。

关键词

引用

@article{arxiv.2502.01436,
  title  = {Towards Safer Chatbots: Automated Policy Compliance Evaluation of Custom GPTs},
  author = {David Rodriguez and William Seymour and Jose M. Del Alamo and Jose Such},
  journal= {arXiv preprint arXiv:2502.01436},
  year   = {2025}
}