换取推理时间计算以提高对抗鲁棒性
机器学习
2025-02-03 v1 密码学与安全
摘要
我们对增加推理时间计算对推理模型(具体为 OpenAI o1-preview 和 o1-mini)对抗攻击鲁棒性的影响进行实验。我们发现,在多种攻击方式下,增加推理时间计算会导致鲁棒性提升。在许多情况下(有重要例外),攻击成功的模型样本比例随测试时间计算量的增大而趋于零。我们所研究的任务未进行对抗训练,仅通过增加模型在推理阶段用于推理的时间来提升计算,独立于攻击形式。我们的结果表明,推理时间计算有望提高大型语言模型的对抗鲁棒性。我们还探索了针对推理模型的新型攻击,以及推理时间计算在可靠性提升方面不具备帮助的情形,并对这些现象以及可能的解决方法进行了推测。
引用
@article{arxiv.2501.18841,
title = {Trading Inference-Time Compute for Adversarial Robustness},
author = {Wojciech Zaremba and Evgenia Nitishinskaya and Boaz Barak and Stephanie Lin and Sam Toyer and Yaodong Yu and Rachel Dias and Eric Wallace and Kai Xiao and Johannes Heidecke and Amelia Glaese},
journal= {arXiv preprint arXiv:2501.18841},
year = {2025}
}