TRUCE:用于防止污染并改进大语言模型比较评估的私有基准测试
密码学与安全
2024-06-25 v2 计算与语言
摘要
基准测试因其速度快、可复现性强且成本低,已成为评估大语言模型(LLMs)的事实标准。然而,最近的研究指出,目前大多数开源基准测试已被污染或泄露到大语言模型中,这意味着大语言模型在预训练和/或微调期间能够访问测试数据。这引发了对迄今为止进行的基准测试研究的有效性以及未来使用基准测试进行评估的严重担忧。为解决这一问题,我们提出了私有基准测试(Private Benchmarking),这是一种测试数据集保持私密且在评估过程中不向模型泄露测试数据的解决方案。我们描述了各种场景(取决于对模型所有者或数据集所有者的信任程度),并提出了利用私有基准测试避免数据污染的解决方案。对于需要保持模型权重私密的场景,我们描述了来自机密计算和密码学的解决方案,以辅助私有基准测试。我们构建了一个端到端系统 TRUCE,实现了此类私有基准测试,表明保护模型和基准测试所引入的开销在机密计算情况下可忽略不计,而在需要密码学安全性时则是可处理的。最后,我们还讨论了基准测试数据集审计问题的解决方案,以确保私有基准测试具有足够高的质量。
引用
@article{arxiv.2403.00393,
title = {TRUCE: Private Benchmarking to Prevent Contamination and Improve Comparative Evaluation of LLMs},
author = {Tanmay Rajore and Nishanth Chandran and Sunayana Sitaram and Divya Gupta and Rahul Sharma and Kashish Mittal and Manohar Swaminathan},
journal= {arXiv preprint arXiv:2403.00393},
year = {2024}
}