Kintsugi:通过修复可执行知识库学习策略
机器学习
2026-05-12 v1
摘要
现代具身智能体取得了令人瞩目的性能,但其任务知识通常存储在神经权重、潜在状态或与提示绑定的记忆中,使得个体策略知识难以检查、验证、重组和重用。我们引入了\textbf{Kintsugi},这是一个白盒策略学习框架,它将具身策略改进视为类型化可执行知识库(KB)的验证器门控构建过程。Kintsugi将任务级策略知识表示为可组合的类型化条目——谓词、算子、策略模式、监视器、恢复规则、经验记录和目标——并通过由 rollout 证据引发的局部类型化编辑来改进该工件,而不是依赖于测试时的语言模型推理。在 rollout 之间,一个工具约束的智能体编辑循环会诊断轨迹故障,将其定位到可编辑的 KB 层,并提出候选编辑。仅当候选编辑通过类型检查、生成的 KB 可执行,且聚焦验证成功率或轨迹健康度指标在不违反受保护回归检查的情况下得到改善时,确定性验证门才会接受该编辑。在推理阶段,被接受的 KB 由确定性符号执行器执行,无需任何 LLM 调用。在长时程文本智能体基准测试和具有代表性的以对象为中心的操控环境中,Kintsugi 在保持可检查性、局部可编辑性和验证器门控部署的同时,实现了强大的端点性能。这些结果表明,具身策略改进可以围绕可执行任务知识来组织。
引用
@article{arxiv.2605.09487,
title = {Kintsugi: Learning Policies by Repairing Executable Knowledge Bases},
author = {Teng Cao and Yu Deng and Hikaru Shindo and Quentin Delfosse and Lanxi Wen and Suli Wang and Jannis Blüml and Christopher Tauchmann and Kristian Kersting},
journal= {arXiv preprint arXiv:2605.09487},
year = {2026}
}