AERO:基于内生双环反馈的自主演化推理优化
计算与语言
2026-02-05 v2
摘要
大型语言模型 (LLM) 在复杂推理任务中取得了显著成功,但仍受制于依赖专家标注数据和外部验证器的瓶颈。虽然已有自我演化范例旨在规避这些限制,但往往无法识别最优学习区域,或通过 flawed 的内部反馈强化集体幻觉和错误先验。为此,我们提出了Autonomous Evolutionary Reasoning Optimization (AERO),一种无监督框架,通过内化自问自答与批判于一个协同的双环系统中,实现自主推理演化。灵感来自“可观测区 (ZPD)”理论,AERO 利用熵基于定位以目标“可解性差距”,并采用独立反事实校正进行稳健验证。此外,我们引入交错训练策略以跨功能角色同步能力增长,防止课程崩溃。在覆盖三个领域、九个基准测试的广泛评估中,AERO 在 Qwen3-4B-Base 上实现平均性能提升 4.57%,在 Qwen3-8B-Base 上实现平均性能提升 5.10%,超越竞争性基线。代码已公开于 https://github.com/mira-ai-lab/AERO。
引用
@article{arxiv.2602.03084,
title = {AERO: Autonomous Evolutionary Reasoning Optimization via Endogenous Dual-Loop Feedback},
author = {Zhitao Gao and Jie Ma and Xuhong Li and Pengyu Li and Ning Qu and Yaqiang Wu and Hui Liu and Jun Liu},
journal= {arXiv preprint arXiv:2602.03084},
year = {2026}
}