中文

TSUBASA:通过演化记忆与基于上下文蒸馏的自学习改进长时程个性化

计算与语言 2026-04-10 v1 人工智能

摘要

个性化大语言模型(PLLM)因其能够使输出与个人需求和偏好对齐而受到广泛关注。然而,它们在处理长时程任务时仍然存在困难,例如跟踪用户大量的历史对话或活动。现有的记忆机制通常无法捕捉不断演变的行为,而RAG范式则受困于质量与效率的权衡。同时,参数化适应由于标记数据的稀缺而面临训练-推理差距的瓶颈。为了增强PLLM的长时程能力,我们引入了TSUBASA,这是一种双管齐下的方法,旨在通过动态记忆演化改进记忆写入,并通过使用上下文蒸馏目标进行自学习来内化用户经验,从而改进记忆读取。在使用Qwen-3模型系列(4B到32B)对长时程基准进行的广泛评估中,验证了TSUBASA的有效性,它超越了主要依赖记忆写入的竞争性记忆增强系统,如Mem0和Memory-R1。我们的分析进一步证实,TSUBASA打破了质量-效率壁垒,实现了帕累托改进,在减少令牌预算的情况下,提供了稳健、高保真度的个性化。

关键词

引用

@article{arxiv.2604.07894,
  title  = {TSUBASA: Improving Long-Horizon Personalization via Evolving Memory and Self-Learning with Context Distillation},
  author = {Xinliang Frederick Zhang and Lu Wang},
  journal= {arXiv preprint arXiv:2604.07894},
  year   = {2026}
}