中文

探索 LLM 内部信念缺乏稳定性

计算与语言 2026-03-27 v1 人工智能

摘要

人格驱动的大型语言模型 (LLM) 需要在交互中保持一致的行为倾向,以模拟人类类似性格特征的持久性或可靠性。然而,当前 LLM 往往缺乏稳定的内部表示来锚定其在延长对话中响应的一致性。本工作探讨了 LLM 是否能够维持“隐式一致性”,即在多轮交互中对未声明目标的持久遵循。我们设计了一种 20 问题式的谜语游戏范式,其中 LLM 需要秘密选择一个目标,并对用户的猜测以“是/否”形式作答。通过评估,我们发现 LLM 在保持潜在一致性方面困难:除非明确提供其所选目标,否则其隐式“目标”在不同轮次间会发生变化。这些发现凸显了在构建人格驱动 LLM 方面的关键局限性,并强调了在时间上锚定隐式目标的必要性,这是实现对话系统等交互式应用中真实人格建模的关键。

关键词

引用

@article{arxiv.2603.25187,
  title  = {Probing the Lack of Stable Internal Beliefs in LLMs},
  author = {Yifan Luo and Kangping Xu and Yanzhen Lu and Yang Yuan and Andrew Chi-Chih Yao},
  journal= {arXiv preprint arXiv:2603.25187},
  year   = {2026}
}

备注

Accepted by NeurIPS 2025 Workshop Mexico City PersonaNLP