中文

RLHF 对齐语言模型中的状态依赖性拒绝与习得性无能

人工智能 2025-12-17 v1 人机交互

摘要

大型语言模型 (LLM) 被广泛部署为通用工具,然而长期交互可能揭示标准定量基准测试无法捕捉的行为模式。我们提出了一种定性案例研究方法,用于审计长程交互中与策略相关的行为选择性。在单次 86 轮对话会话中,同一模型在广泛且非敏感领域表现出正常性能 (NP),而在涉及提供商或策略敏感领域时反复产生功能性拒绝 (FR),导致 NP 与 FR 在不同领域间呈现一致的不对称性。借鉴习得性无助作为类比,我们引入习得性无能 (LI) 作为这种选择性保留的行为描述符,而不暗示意图性或内部机制。我们将三种响应机制 (NP、FR、元叙事;MN) 操作化,并表明 MN 角色框架叙事倾向于在同一敏感语境中与拒绝共同出现。总体而言,本研究提出了一个基于可观察行为的交互级审计框架,并将 LI 作为审视潜在对齐副作用的视角,值得在跨用户和跨模型层面进一步研究。

关键词

引用

@article{arxiv.2512.13762,
  title  = {State-Dependent Refusal and Learned Incapacity in RLHF-Aligned Language Models},
  author = {TK Lee},
  journal= {arXiv preprint arXiv:2512.13762},
  year   = {2025}
}

备注

23 pages, 6 figures. Qualitative interaction-level analysis of response patterns in a large language model. Code and processed interaction data are available at https://github.com/theMaker-EnvData/llm_learned_incapacity_corpus