中文

若LLM是角色,它是否认识自己的故事?评估LLM中的终身学习

计算与语言 2026-04-14 v2 人工智能

摘要

大型语言模型(LLM)能够进行类人对话,但与人类不同,它们是无状态的 due to the superposition property。然而,在多轮、多智能体交互期间,LLM开始表现出一致的、类似角色的行为,这暗示着一种类终身学习的形式。尽管如此,现有基准通常无法捕捉这些动态,主要关注静态、开放式评估。为填补这一差距,我们引入LIFESTATE-BENCH,用于评估LLM中的终身学习。它包含两个情节数据集:Hamlet和一个丰富于叙事结构和角色互动的合成脚本集合。我们的事实检查评估探测模型的自我意识、情节记忆检索和关系跟踪,涵盖参数和非参数方法。在Llama3.1-8B、GPT-4-turbo和DeepSeek R1等模型上进行实验,我们展示,非参数方法在管理有状态学习方面显著优于参数方法。然而,所有模型在交互延长时都表现出严重遗忘的问题,这凸显了在终身学习方面仍需进一步发展的必要性。

关键词

引用

@article{arxiv.2503.23514,
  title  = {If an LLM Were a Character, Would It Know Its Own Story? Evaluating Lifelong Learning in LLMs},
  author = {Siqi Fan and Xiusheng Huang and Yiqun Yao and Xuezhi Fang and Kang Liu and Peng Han and Shuo Shang and Aixin Sun and Yequan Wang},
  journal= {arXiv preprint arXiv:2503.23514},
  year   = {2026}
}