中文

CosmoCore:基于情感梦境回放的强化学习代码生成

软件工程 2025-10-23 v1 人工智能 人机交互

摘要

我们提出了CosmoCore,一种受神经科学启发的强化学习(RL)架构,将情感信号整合以增强大型语言模型(LLMs)中的代码生成。在人类和动物学习中,来自错误的羞耻感驱动快速纠正,正如在训练小狗避免在一次训斥后重复错误后所观察到的那样。CosmoCore通过轻量级多层感知器(MLP)为代码生成轨迹标记价值和惊讶。高负面价值(cringe)情景(例如有缺陷的代码输出)被优先放入梦境队列进行五次回放,以进行离策略更新,而低惊讶的成功则被修剪以防止过度自信和缓冲膨胀。在HumanEval和BigCodeBench等代码生成基准测试以及来自自定义数据管道环境的仿真中评估,CosmoCore通过48%减少幻觉代码(例如语法错误或逻辑缺陷),并加快自我纠正速度45%。在PySpark环境中使用Hugging Face模型的本地实验验证了这些收益,提供了代码片段以便复制。消融实验确认价值标记提高了探索中的好奇心,而修剪可缓解效率问题。该框架将RL从人类反馈(RLHF)扩展到更具情感感知能力的代码助手,具有可用于IDE和数据管道的应用。随同行代码和自定义mini-world仿真一起发布。

关键词

引用

@article{arxiv.2510.18895,
  title  = {CosmoCore Affective Dream-Replay Reinforcement Learning for Code Generation},
  author = {Santhosh Kumar Ravindran},
  journal= {arXiv preprint arXiv:2510.18895},
  year   = {2025}
}

备注

12 pages