中文

HiddenGuard:基于专用表示路由器的细粒度安全生成

计算与语言 2024-10-04 v1

摘要

随着大语言模型(LLM)日益强大, 确保其安全性和与人类价值观的一致性仍是关键挑战。理想情况下, LLM 应能提供信息性响应, 同时避免披露有害或敏感信息。然而, 当前对齐方法依赖大量拒绝策略, 如训练模型完全拒绝有害提示或应用粗糙过滤器, 受其二元性限制。这些方法要么完全否认信息获取, 要么在不足够细致的情况下授予信息, 导致过于谨慎的响应或未能检测到微妙的有害内容。例如, LLM 可能因滥用担忧而拒绝提供关于药物的基本公共信息。此外, 这些基于拒绝的方法难以处理混合内容场景, 缺乏适应上下文依赖敏感性的能力, 可导致对良性内容的过度审查。为克服这些挑战, 我们引入 HiddenGuard, 一个用于 LLM 细粒度安全生成的新框架。HiddenGuard 包含 Prism(面向流内 moderation 的表示路由器, Prism), 其可与 LLM 协同工作, 以利用中间隐藏状态实现实时、令牌级有害内容检测与编辑。这种细粒度方法允许更细致、情境感知的审查, 使模型能够生成信息丰富的响应, 同时对敏感信息进行选择性编辑或替换, 而非直接拒绝。我们还贡献了一个包含跨多样化语境中可能有害信息令牌级细粒度注释的全面数据集。我们的实验表明, HiddenGuard 在检测和编辑有害内容方面 F1 分数可超过 90%, 在保持模型响应整体实用性和信息性方面也取得良好效果。

关键词

引用

@article{arxiv.2410.02684,
  title  = {HiddenGuard: Fine-Grained Safe Generation with Specialized Representation Router},
  author = {Lingrui Mei and Shenghua Liu and Yiwei Wang and Baolong Bi and Ruibin Yuan and Xueqi Cheng},
  journal= {arXiv preprint arXiv:2410.02684},
  year   = {2024}
}