大语言模型口头置信度在对抗性攻击中的鲁棒性研究
计算与语言
2025-12-19 v3
摘要
大型语言模型(LLMs)生成的鲁棒口头置信度对于部署大语言模型至关重要,有助于确保许多应用中的透明度、信任和安全,尤其是涉及人类与AI交互的场景。本文首次系统地研究了在对抗性攻击下的口头置信度鲁棒性。我们提出针对口头置信度得分的攻击框架,包括扰动方法和劫持(Jailbreak)方法,并展示这些攻击显著损害口头置信度估计,导致频繁的答案变更。我们检验了各种提示策略、模型规模和应用领域,揭示当前口头置信度易受攻击,而常用防御技术大多无效或适得其反。我们的发现凸显了设计大语言模型置信表达鲁棒机制的必要性,因为即使是细微的语义保护修改也会导致对响应置信度的误导。
引用
@article{arxiv.2507.06489,
title = {On the Robustness of Verbal Confidence of LLMs in Adversarial Attacks},
author = {Stephen Obadinma and Xiaodan Zhu},
journal= {arXiv preprint arXiv:2507.06489},
year = {2025}
}
备注
Published in NeurIPS 2025