中文

SafeGPT:防止企业级大语言模型使用中的数据泄露与不道德输出

密码学与安全 2026-05-26 v3 人工智能

摘要

大型语言模型(LLM)正在改变企业工作流程,但在员工无意中分享机密数据或生成违规内容时引入了安全和伦理挑战。本文提出 SafeGPT,一个双侧警戒系统,用于防止敏感数据泄露和不道德输出。SafeGPT 集成了输入侧检测/红acted、输出侧 moderation/重构以及人类在环反馈。实验表明,SafeGPT 有效降低了数据泄露风险和偏见输出,同时保持了用户满意度。

关键词

引用

@article{arxiv.2601.06366,
  title  = {SafeGPT: Preventing Data Leakage and Unethical Outputs in Enterprise LLM Use},
  author = {Pratyush Desai and Luoxi Tang and Yuqiao Meng and Zhaohan Xi},
  journal= {arXiv preprint arXiv:2601.06366},
  year   = {2026}
}