Kubernetes 的操作记忆架构:在证据视界内保留因果上下文
摘要
Kubernetes 集群在 Pod 生命周期转换期间会生成丰富的操作事件,然而该平台原生的事件保留机制会丢弃最具诊断价值的上下文。记录容器上次失败状态的 LastTerminationState 字段在 Pod 重启后不久就会被覆盖。我们将此定义为证据视界。在高频崩溃循环期间,该视界可能在检查前被多次跨越,从而永久丢失关键证据。本文引入了操作记忆架构(OMA),以在事件轮换前保留因果失败证据。OMA 将证据保留和因果重构编码为显式的架构需求。它使用三种模式将操作事件捕获为因果链:P001(OOMKill 链)、P002(ConfigMap 变量配置错误)和 P003(ConfigMap 卷挂载传播)。我们将 OMA 实现为一个开源系统,包含基于 Go 的 Kubernetes watcher、SQLite 操作记忆存储库和一个简单的查询接口。在 Minikube 和 AKS 上的实验包括 30 次运行的延迟分析以及多达 20 个崩溃循环 Pod 的压力测试。因果边的构建平均延迟低于 1 ms。收集器以约 2.8 事件/秒的速率处理事件,同时使用不到 10 MB 的内存,表明其开销极小且能有效保留证据。
引用
@article{arxiv.2605.18755,
title = {Operational Memory Architecture for Kubernetes:Preserving Causal Context Across the Evidence Horizon},
author = {Shamsher Khan},
journal= {arXiv preprint arXiv:2605.18755},
year = {2026}
}
备注
14 pages, 4 figures, 4 tables. Empirical evaluation of Kubernetes event retention and an operational memory architecture preserving causal failure evidence. Includes 30-run statistical validation and concurrent stress testing on Minikube and Azure Kubernetes Service (AKS). Code and dataset available at https://github.com/opscart/k8s-causal-memory