中文

LLM 类内强化学习

计算与语言 2025-11-18 v1 密码学与安全

摘要

当前的大型语言模型对齐研究主要 focuses on通过训练示例和提示改进模型对对抗性攻击和异常行为的鲁棒性。研究表明,LLM 越狱概率会随用户输入长度或对话长度的增加而上升。缺乏针对能够随用户输入长度增长而扩缩的对齐方式的合适研究。我们提出将中断作为可能的解决方案。中断是添加到用户输入中约每 x 个 token 的控制句子,其中 x 为任意值。我们建议这可以泛化为链式思维过程,以防止规划(scheming)。

关键词

引用

@article{arxiv.2511.12782,
  title  = {LLM Reinforcement in Context},
  author = {Thomas Rivasseau},
  journal= {arXiv preprint arXiv:2511.12782},
  year   = {2025}
}

备注

4 pages