ATANT:AI 连续性的评估框架
人工智能
2026-04-21 v2 信息检索
摘要
我们提出 ATANT(Automated Test for Acceptance of Narrative Truth),一个用于衡量 AI 系统连续性的开源评估框架:即系统在时间上持久、更新、消除歧义并重建有意义上下文的能力。尽管 AI 行业已产生记忆组件(RAG 流水线、向量数据库、长上下文窗口、配置文件层),但尚无已发布框架正式定义或衡量这些组件是否产生真正的连续性。我们将连续性定义为系统属性,其包含 7 项必需属性,引入 10 步检验方法论,其无需评估循环中的 LLM,呈现由 250 篇故事构成的叙事测试语料库,包含 1,835 个验证问题,覆盖 6 个生活领域。我们在 5 个测试套 iterations 中评估了参考实现,从 58%(旧架构)到 100%(孤立模式下 250 篇故事)以及 100%(50 篇故事累积模式),在 250 篇故事累积规模下为 96%。累积结果为主要衡量指标:当 250 篇不同的生活叙事共存于同一数据库时,系统必须在不产生交叉污染的前提下检索正确事实以匹配正确上下文。ATANT 是系统无关、模型无关的,并设计为用于构建和验证连续性系统的序列化方法论。框架规格、示例故事和评估协议已发布于 https://github.com/Kenotic-Labs/ATANT。完整的 250 篇故事语料库将逐步发布。
引用
@article{arxiv.2604.06710,
title = {ATANT: An Evaluation Framework for AI Continuity},
author = {Samuel Sameer Tanguturi},
journal= {arXiv preprint arXiv:2604.06710},
year = {2026}
}
备注
7 pages, 8 tables. Framework and evaluation protocol available at https://github.com/Kenotic-Labs/ATANT and https://kenoticlabs.com/