RoFL:面向语言模型的鲁棒指纹识别
机器学习
2025-05-20 v1
摘要
AI 开发者以各种不同许可证发布大型语言模型(LLM)。许多许可证限制模型或其输出的使用方式。这引出一个问题:如何识别许可证违规?特别是,如何识别某个 API 或产品是否使用(或其经过修改的)特定语言模型?我们提出一种新方法,使模型开发者能够通过指纹来执行此类识别:这些是唯一属于开发者模型的统计模式,且对常见的模型或推理设置的变更具有鲁棒性。我们的方法允许在黑盒环境中使用有限的查询次数进行模型识别,从而可识别仅通过 API 或产品访问的模型。这些指纹是非侵入性的: our 方法在训练期间不需要对模型进行任何修改,因此设计上不会影响模型质量。实验结果表明,我们的方法对常见的模型或推理设置变更具有高度鲁棒性。在实验中,该方法在性能上显著优于先前方法,包括明确将水印训练到模型中的侵入性方法。
引用
@article{arxiv.2505.12682,
title = {RoFL: Robust Fingerprinting of Language Models},
author = {Yun-Yun Tsai and Chuan Guo and Junfeng Yang and Laurens van der Maaten},
journal= {arXiv preprint arXiv:2505.12682},
year = {2025}
}