中文

生存是唯一奖励:通过环境介导选择实现可持续自训练

人工智能 2026-01-21 v1

摘要

自训练系统常因缺乏评判数据质量的外部标准而退化,导致奖励黑客和语义漂移。本文提供了一个在稀疏外部反馈和有界记忆下实现稳定自训练的概念验证系统架构,并实证刻画了其学习动态和失效模式。我们引入一种自训练架构,其中学习完全由环境生存能力介导,而非奖励、目标函数或外部定义的适应度标准。候选行为在真实的资源约束下执行,只有那些其环境影响既持久又保留了未来交互可能性的行为才会被传播。环境不提供语义反馈、密集奖励或特定任务的监督;选择仅通过行为作为改变世界的事件的差异化生存来进行,这使得代理优化不可能实现,并使奖励黑客行为在演化上不稳定。语义动态分析表明,改进主要源于有效且可重复的策略在巩固与修剪机制下的持久性,我们将此范式称为负空间学习(NSL),并且模型在没有明确指令的情况下发展出了元学习策略(例如,故意实验失败以获取信息丰富的错误消息)。这项工作确立了基于环境的选择能够实现可持续的开放式自我改进,为不依赖人工整理数据或复杂奖励塑造的更鲁棒、更通用的自主系统提供了一条可行路径。

关键词

引用

@article{arxiv.2601.12310,
  title  = {Survival is the Only Reward: Sustainable Self-Training Through Environment-Mediated Selection},
  author = {Jennifer Dodgson and Alfath Daryl Alhajir and Michael Joedhitya and Akira Rafhael Janson Pattirane and Surender Suresh Kumar and Joseph Lim and C. H. Peh and Adith Ramdas and Steven Zhang Zhexu},
  journal= {arXiv preprint arXiv:2601.12310},
  year   = {2026}
}