LLM 类内强化学习
计算与语言
2025-11-18 v1 密码学与安全
摘要
当前的大型语言模型对齐研究主要 focuses on通过训练示例和提示改进模型对对抗性攻击和异常行为的鲁棒性。研究表明,LLM 越狱概率会随用户输入长度或对话长度的增加而上升。缺乏针对能够随用户输入长度增长而扩缩的对齐方式的合适研究。我们提出将中断作为可能的解决方案。中断是添加到用户输入中约每 x 个 token 的控制句子,其中 x 为任意值。我们建议这可以泛化为链式思维过程,以防止规划(scheming)。
引用
@article{arxiv.2511.12782,
title = {LLM Reinforcement in Context},
author = {Thomas Rivasseau},
journal= {arXiv preprint arXiv:2511.12782},
year = {2025}
}
备注
4 pages