中文

面向可靠内容审查的 LLM 守护模型校准研究

密码学与安全 2025-02-25 v2 计算与语言 机器学习

摘要

大型语言模型 (LLM) 因可能生成有害内容或用户尝试规避守护屏障而构成重大风险。现有研究开发了基于 LLM 的守护模型,用于Moderate 输入和输出,以确保遵守安全策略,阻止违反这些协议的内容在部署时被阻止。然而,对此类守护模型可靠性和校准的关注有限。本文我们在12个基准测试中对9个现有的基于 LLM 的守护模型进行置信校准的全面实证调查。我们的发现表明,当前的基于 LLM 的守护模型倾向于1)产生过于自信的预测,2)在遭受越狱攻击时表现出显著的误校准,3)对由不同类型响应模型生成的输出鲁棒性有限。此外,我们评估了后验校准方法以缓解误校准的效果。我们展示了温度缩放的有效性,并首次凸显了在缺乏验证集的情况下,语境校准对守护模型置信度校准的益处。我们的分析和实验凸显了当前基于 LLM 的守护模型的局限性,并为未来开发更可靠的内容审查守护模型提供了宝贵的见解。我们还主张在发布未来的基于 LLM 的守护模型时,纳入置信度校准的可靠性评估。

关键词

引用

@article{arxiv.2410.10414,
  title  = {On Calibration of LLM-based Guard Models for Reliable Content Moderation},
  author = {Hongfu Liu and Hengguan Huang and Xiangming Gu and Hao Wang and Ye Wang},
  journal= {arXiv preprint arXiv:2410.10414},
  year   = {2025}
}

备注

Accepted to ICLR 2025