大语言模型中的领域认证
计算与语言
2025-03-10 v2 人工智能
密码学与安全
机器学习
机器学习
摘要
大语言模型(LLM)常被部署以执行受限任务,具有狭窄领域。例如,客户支持机器人可以在LLM之上构建,依赖其广泛的语言理解和能力来提升性能。然而,这些LLM可能对对抗性攻击高度敏感,可能生成超出预期领域的输出。为正式化、评估和缓解这一风险,我们引入了领域认证;一种准确描述语言模型超出领域行为的保证。我们然后提出一种简单而有效的方法,称为 VALID 提供对抗界限作为证书。最后,我们在多样化的数据集上评估该方法,证明它产生有意义的证书,这些证书以最小惩罚限制行为,紧密界限超出领域样本的概率。
引用
@article{arxiv.2502.19320,
title = {Shh, don't say that! Domain Certification in LLMs},
author = {Cornelius Emde and Alasdair Paren and Preetham Arvind and Maxime Kayser and Tom Rainforth and Thomas Lukasiewicz and Bernard Ghanem and Philip H. S. Torr and Adel Bibi},
journal= {arXiv preprint arXiv:2502.19320},
year = {2025}
}
备注
10 pages, includes appendix Published in International Conference on Learning Representations (ICLR) 2025