中文

思维认知激发大语言模型的社会对齐推理

计算与语言 2025-10-15 v2

摘要

大语言模型(LLM)在复杂推理方面表现出色,但仍可能表现出有害行为。当前对齐策略通常将安全性嵌入模型权重中,使这些控制变得隐式、静态且难以修改。本文引入了思维认知(Cognition-of-Thought,CooT),一种新颖的解码时框架,为LLM配备显式的认知自监控循环。CooT将标准文本生成器与认知感知器耦合,后者持续监控展开的序列。感知器使用结构化的、基于优先级的原则层次(例如安全性优先于服从性)来检测出现的潜在不对齐。当违规被标记时,CooT通过回滚生成至错误发生点并在注入的引导下重新生成来进行干预,该引导结合了通用社会先验与上下文特定的警告。CooT因此将对齐从固定属性转变为在推理期间活跃的显式、动态和可审计过程,允许在不重新训练模型的情况下进行灵活的策略更新。在多个基准和模型家族上的广泛实验证实,CooT一致地改善了安全性和社会推理性能。

关键词

引用

@article{arxiv.2509.23441,
  title  = {Cognition-of-Thought Elicits Social-Aligned Reasoning in Large Language Models},
  author = {Xuanming Zhang and Yuxuan Chen and Samuel Yeh and Sharon Li},
  journal= {arXiv preprint arXiv:2509.23441},
  year   = {2025}
}