基于投票的随机重jection方法框架用于语言模型的安全输出
人工智能
2025-09-30 v3 计算与语言
机器学习
摘要
我们提出一种防止大型语言模型(LLM)生成不安全或低质量输出的方法,利用LLM的随机性,称为基于投票的随机重jection方法框架(Voter-Based Stochastic Rejection-Method Framework)。在该系统中,LLM检查器对生成的输出进行投票决定是否可接受,如果达到一定数量的反对意见则重新生成,直到有足够的检查器批准。基于我们的成本和失败率估计以及针对具体应用的实验数据,我们的算法在达到期望失败率的同时实现了帕累托最优成本。失败率随成本呈指数级下降,模型能够合理地估计该系统实际运行中的性能,即使数据有限。该方法不依赖于所使用的语言模型,能够让廉价、小型的LLM控制、约束或在某些任务上甚至超过非常复杂且昂贵的模型。
关键词
引用
@article{arxiv.2407.16994,
title = {A Voter-Based Stochastic Rejection-Method Framework for Asymptotically Safe Language Model Outputs},
author = {Jake R. Watts and Joel Sokol},
journal= {arXiv preprint arXiv:2407.16994},
year = {2025}
}
备注
7 pages, 2 figures