中文

时间到不一致性:大型语言模型对抗攻击鲁棒性的生存分析

计算与语言 2026-02-05 v4 人工智能 机器学习

摘要

大型语言模型 (LLM) 已彻底革新了对话式 AI,但其在持续多轮对话中的鲁棒性仍鲜为人知。现有评估框架侧重于静态基准和单轮评估,无法捕捉真实交互中典型的对话退化的时序动态。本文提出了一种针对对话鲁棒性的大规模生存分析,将失败建模为跨 36,951 轮来自 9 个最先进大型语言模型的事件发生时间过程。我们的框架将比例危害模型 (Cox proportional hazards)、加速失效时间模型 (Accelerated Failure Time, AFT) 以及随机生存森林模型与简单语义漂移特征相结合。我们发现,突发的提示-提示语义漂移会显著增加不一致风险,而累积性漂移则反而具有保护作用,这表明在经历多次偏移后仍存续的对话具有适应性。采用模型-漂移相互作用的 AFT 模型在判别性和校准性之间取得最佳组合,比例危害检验揭示了关键漂移协变量存在系统性违反,这解释了 Cox 式建模在此情境下的局限性。最后,我们展示了一个轻量级 AFT 模型可被转化为用于逐轮风险监控的工具,在首次不一致答案之前即可数轮提前标记大多数将要失败的对话,而同时保持误报率适度。这些结果确立了生存分析作为评估多轮鲁棒性及为对话式 AI 系统设计实用防御措施的强大范式。

关键词

引用

@article{arxiv.2510.02712,
  title  = {Time-To-Inconsistency: A Survival Analysis of Large Language Model Robustness to Adversarial Attacks},
  author = {Yubo Li and Ramayya Krishnan and Rema Padman},
  journal= {arXiv preprint arXiv:2510.02712},
  year   = {2026}
}