中文

面向智能增长:SuperIntelliAgent 中的自训练、持续学习与双尺度记忆

人工智能 2025-12-01 v1

摘要

我们引入 SuperIntelliAgent,一个智能体学习框架,通过自监督交互实现持续智能增长。该框架将可训练的小型扩散模型(学习者)与冻结的大型语言模型(验证者)耦合,使其能够通过自我监督交互实现持续学习。不同于常规的监督式微调,SuperIntelliAgent 在没有注释的情况下自主学习:学习者生成候选输出,验证者通过逐步推理进行评估,其交互产生选定/被拒的配对,用于直接偏好优化(DPO)。这将每个输入转换为伪训练信号,用于持续改进。该框架集成双尺度记忆:短期情境记忆在细化循环中保存推理痕迹,长期记忆通过轻量级即时微调来巩固已获取的知识。回放缓冲区保留显示可验证进展的样本,并将其作为辅助监督进行回放,以强化最近的学习同时形成自适应课程。SuperIntelliAgent 具有基础设施无关性,可插入现有智能体框架,同时将普通推理循环转化为生命周期优化过程。我们认为,将可训练的学习者与具有推理能力的验证者配对形成一种最小可靠的智能增长单元,因为配对反馈和部分历史回放可产生更丰富的学习课程并增强偏好对齐。通过少量自动生成的 DPO 配对,学习者在所有基准测试中均获得改进,表明该机制为持续智能积累和实际部署提供了有前景的方向。

关键词

引用

@article{arxiv.2511.23436,
  title  = {Towards Continuous Intelligence Growth: Self-Training, Continual Learning, and Dual-Scale Memory in SuperIntelliAgent},
  author = {Jianzhe Lin and Zeyu Pan and Yun Zhu and Ruiqi Song and Jining Yang},
  journal= {arXiv preprint arXiv:2511.23436},
  year   = {2025}
}

备注

15 pages, 4 figures