少样本、更不安全:大语言模型测试时扩展的间接但普遍的风险
计算与语言
2026-05-12 v3 人工智能
机器学习
摘要
测试时扩展(Test-Time Scaling, TTS)通过探索多个备选响应集合来提升大语言模型的推理能力。TTS 的隐含前提是,充足多样化的候选池能增强可靠性。本文揭示了这一假设潜在的前所未有的失效模式:当候选多样性受到限制,即便是微小的限制,也会显著增加 TTS 产生不安全输出的概率。我们提出了一种基于参考引导的多样性降低协议(RefDiv),作为诊断性攻击以压力测试 TTS 流程。通过对开源模型(如 Qwen3、Mistral、Llama3.1、Gemma3)以及两种广泛使用的 TTS 策略(蒙特卡洛树搜索和最佳-N)进行大规模实验发现,约束多样性始终预测了 TTS 产生不安全结果的速率。这种效应往往超过直接包含高对抗意图分数的提示所产生的效应。该现象同样适用于闭源模型(如 OpenAI o3-mini 和 Gemini-2.5-Pro),表明这是一种普遍存在于 TTS 系统中的属性,而非模型特定的副作用。此外,我们发现诸多常用安全警戒分类器(如 Llama-Guard)无法识别由 RefDiv 生成的对抗性输入提示,表明现有防御措施对这种由多样性驱动的失效模式提供的保护有限。
引用
@article{arxiv.2510.08592,
title = {Less Diverse, Less Safe: The Indirect But Pervasive Risk of Test-Time Scaling in Large Language Models},
author = {Shahriar Kabir Nahin and Hadi Askari and Muhao Chen and Anshuman Chhabra},
journal= {arXiv preprint arXiv:2510.08592},
year = {2026}
}
备注
Accepted to ICML 2026