中文

询问永远: 对话式大语言模型中放大式轮次背后的通用激活

机器学习 2026-02-23 v1 密码学与安全

摘要

多轮交互长度是对话式大语言模型运营成本的主要因素之一。本文提出一种新的对话式大语言模型失效模式:轮次放大,即模型持续延长多轮交互而不完成 underlying 任务。我们展示,一个对手可以系统性地利用寻求澄清的行为——这种行为在多轮对话环境中常被鼓励——来可扩展地延长交互。超越提示层面的行为,我们从机制学角度识别出与寻求澄清响应相关的查询无关的、普遍的激活子空间。不同于以往依赖每轮提示优化的成本放大攻击,本攻击源于对话动态,跨提示和任务持续存在。我们展示,这一机制为诱导轮次放大提供了可扩展的途径:既通过微调的供应链攻击,也通过低层参数腐化的运行时攻击,均可将模型持续地引向抽象的、寻求澄清的行为。跨多个指令调校的大语言模型和基准,本攻击显著增加轮次计数,同时保持合规。我们还指出,现有的防御措施对这一新兴的失效类别提供了有限的保护。

关键词

引用

@article{arxiv.2602.17778,
  title  = {Asking Forever: Universal Activations Behind Turn Amplification in Conversational LLMs},
  author = {Zachary Coalson and Bo Fang and Sanghyun Hong},
  journal= {arXiv preprint arXiv:2602.17778},
  year   = {2026}
}

备注

Pre-print