获取财富或死亡:将推理计算换取鲁棒性
机器学习
2026-03-27 v3
摘要
测试时推理已提升基准性能,甚至显示出在应对历史上难以解决的对抗性分布外(OOD)数据鲁棒性问题方面的潜力。事实上,最近的研究利用推理来帮助满足设计用来挫败攻击的模型规格,发现LLM推理 effort与对抗性越狱鲁棒性之间存在惊人的相关性。然而,当使用更强的攻击(如梯度-based或多模态攻击)时,这一好处会消失。这可能是可以预期的,因为模型往往无法在此类攻击创建的对抗性OOD数据上遵循指令,而指令遵循是按照攻击挫败规格行动所必需的。因此,我们假设测试时鲁棒性的好处是通过初始鲁棒性足以在OOD数据上遵循指令来实现的。也就是说,我们认为推理计算防御的鲁棒性会随着模型训练数据更好地反映被攻击数据组件而增强(RICH假设)。根据RICH,我们测试了不同初始鲁棒性水平的模型,发现即使在白盒多模态攻击下,推理计算也能提升鲁棒性,只要模型具备足够的初始鲁棒性。进一步地,尽管InternVL 3.5 gpt-oss 20B在其测试计算规模时几乎没有获得鲁棒性,但如果我们首先鲁棒化其视觉编码器(在过程中创建了第一个对抗性鲁棒推理视觉语言模型),这种规模化的测试计算就会显著提升鲁棒性。鲁棒化模型会使被攻击数据组件更接近分布内(ID),而RICH假设认为这会驱动组合推理——通过其ID组件来理解OOD数据——以遵循对抗数据上的规格指令。持续地,我们发现测试时防御既构建又依赖于训练时的数据和防御。
引用
@article{arxiv.2510.06790,
title = {Get RICH or Die Scaling: Profitably Trading Inference Compute for Robustness},
author = {Tavish McDonald and Bo Lei and Stanislav Fort and Bhavya Kailkhura and Brian Bartoldson},
journal= {arXiv preprint arXiv:2510.06790},
year = {2026}
}
备注
23 pages