中文

SAHOO:递归自我改进中高阶优化目标的受保护对齐

人工智能 2026-03-09 v1 计算与语言 机器学习

摘要

递归自我改进正从理论走向实践:现代系统能够批判、修订和评估自身输出,但迭代自我修改风险会导致细微的对齐漂移。我们提出 SAHOO(Safeguarded Alignment for High-Order Optimization Objectives),一个实用的框架,通过三个保障措施来监控和控制漂移:(i)目标漂移指数(GDI),一种结合语义、词汇、结构和分布性措施的学习型多信号检测器;(ii)约束保持检查,确保关键安全不变量,如语法正确性和非幻觉;(iii)回归风险定量化,用于标记会抵消先前收益的改进循环。在 189 个代码生成、数学推理和真实性任务中,SAHOO 产生了显著的质量提升,包括代码任务中 18.3% 的提升和推理中 16.8% 的提升,同时在两个领域保持约束,维持低水平的真实性违规。阈值在 18 个跨三轮次的任务小型验证集上校准。我们进一步绘制了能力-对齐边界,显示有效的早期改进循环但后期对齐成本上升,并暴露出如流畅性与真实性等特定领域的紧张关系。因此,SAHOO 使递归自我改进期间的对齐保持可衡量、可部署且在规模化环境中得到系统验证。

关键词

引用

@article{arxiv.2603.06333,
  title  = {SAHOO: Safeguarded Alignment for High-Order Optimization Objectives in Recursive Self-Improvement},
  author = {Subramanyam Sahoo and Aman Chadha and Vinija Jain and Divya Chaudhary},
  journal= {arXiv preprint arXiv:2603.06333},
  year   = {2026}
}

备注

Published at ICLR 2026 Workshop on AI with Recursive Self-Improvement. 20 pages, 5 figures