中文

JurEE not Judges: 面向LLM交互的小型专用编码器集合 safeguarding

机器学习 2024-10-15 v2 人工智能

摘要

我们介绍JurEE,这是一个高效的仅编码器变换模型集合,旨加强基于LLM系统中AI用户交互的安全措施。不同于现有的LLM评判方法——这些方法常在风险分类学上难以泛化且仅提供文本输出——JurEE提供跨广泛常见风险的概率性风险估计。我们的方法利用多样化数据源并采用渐进式合成数据生成技术,包括LLM辅助数据增强,以提高模型的鲁棒性和性能。我们构建了一个内部基准测试集合,包括OpenAI Moderation Dataset和ToxicChat等其他权威基准测试,在这些基准测试中,JurEE显著优于基线模型,表现出卓越的准确率、速度和成本效益。这使其特别适用于需要严格内容 moderation 的应用,如面向客户的聊天机器人。该编码器集合的模块化设计允许用户设置量身定制的风险阈值,从而提高其在各种安全相关应用中的灵活性。JurEE的集体决策过程——每个专用编码器模型为最终输出贡献——不仅提高预测准确率,也增强了可解释性。该方法为需要强大内容 moderation 的大规模实现提供了更高效、更高性能、更经济的替代方案。

关键词

引用

@article{arxiv.2410.08442,
  title  = {JurEE not Judges: safeguarding llm interactions with small, specialised Encoder Ensembles},
  author = {Dom Nasrabadi},
  journal= {arXiv preprint arXiv:2410.08442},
  year   = {2024}
}