中文

大语言模型中的领域认证

计算与语言 2025-03-10 v2 人工智能 密码学与安全 机器学习 机器学习

摘要

大语言模型(LLM)常被部署以执行受限任务,具有狭窄领域。例如,客户支持机器人可以在LLM之上构建,依赖其广泛的语言理解和能力来提升性能。然而,这些LLM可能对对抗性攻击高度敏感,可能生成超出预期领域的输出。为正式化、评估和缓解这一风险,我们引入了领域认证;一种准确描述语言模型超出领域行为的保证。我们然后提出一种简单而有效的方法,称为 VALID 提供对抗界限作为证书。最后,我们在多样化的数据集上评估该方法,证明它产生有意义的证书,这些证书以最小惩罚限制行为,紧密界限超出领域样本的概率。

关键词

引用

@article{arxiv.2502.19320,
  title  = {Shh, don't say that! Domain Certification in LLMs},
  author = {Cornelius Emde and Alasdair Paren and Preetham Arvind and Maxime Kayser and Tom Rainforth and Thomas Lukasiewicz and Bernard Ghanem and Philip H. S. Torr and Adel Bibi},
  journal= {arXiv preprint arXiv:2502.19320},
  year   = {2025}
}

备注

10 pages, includes appendix Published in International Conference on Learning Representations (ICLR) 2025