用于区分大型语言模型的二十个问题游戏
计算与语言
2024-09-17 v1 人工智能
摘要
类比于二十个问题游戏,我们提出了一种方法来确定处于黑盒环境中的两个大型语言模型 (LLM) 是否相同。目标是使用一小组(无害的)二元问题,通常在 20 个以内。我们对问题进行了形式化,并首先使用从已知基准数据集中随机选择的问题建立基线,在 20 个问题内实现了接近 100% 的准确率。在展示了该问题的最优界限后,我们引入了两种有效的提问启发式方法,能够使用一半的问题来区分 22 个 LLM 完成相同任务。这些方法在隐蔽性方面具有显著优势,因此对于面临模型泄露嫌疑的审计员或版权所有者具有吸引力。
引用
@article{arxiv.2409.10338,
title = {The 20 questions game to distinguish large language models},
author = {Gurvan Richardeau and Erwan Le Merrer and Camilla Penzo and Gilles Tredan},
journal= {arXiv preprint arXiv:2409.10338},
year = {2024}
}