中文

SIA:基于 Harness 与 Weight Updates 的自我改进 AI

人工智能 2026-05-29 v2 计算与语言

摘要

人类是构建和改进 AI 的瓶颈。模型及其包装 agent 均由人类编写、调优和纠正。能够自行改进的 AI 的长期目标仍是开放问题。两个 largely disjoint的研究线攻克这一瓶颈。harness-update 学派让 meta-agent 重写面向特定任务的 agent(其工具、提示、重试逻辑和搜索程序)的框架,而模型权重保持固定。test-time training 学派使用手写的 RL 流程在任务反馈上更新模型自身的权重,而保持 harness 固定。这两个数据孤岛在孤立中运行。我们提出 SIA,一种在 Feedback-Agent 更新特定任务 agent 的 harness 与权重的循环中实现自我改进的系统。在三个对比域中进行评估:中文法律指控分类、低级 GPU 内核优化和单细胞 RNA 去噪。将两者组合在一起在所有三个基准测试中均优于仅进行框架迭代。SIA-W+H 在 LawBench 上比以前的 SOTA 高出 25.1%,GPU 内核比以前的 SOTA(1017 vs 1161 {\mu}s)快 12.4%,去噪效果比以前的 SOTA 高出 20.4%。Harness 更新使模型具备主动性,塑造其搜索和行动方式,而权重更新构建了无法通过提示或框架激发的领域直觉。

关键词

引用

@article{arxiv.2605.27276,
  title  = {SIA: Self Improving AI with Harness & Weight Updates},
  author = {Prannay Hebbar and Yogendra Manawat and Samuel Verboomen and Alesia Ivanova and Selvam Palanimalai and Kunal Bhatia and Vignesh Baskaran},
  journal= {arXiv preprint arXiv:2605.27276},
  year   = {2026}
}