中文

$A^3$-Bench:通过锚点与吸引子激活对记忆驱动的科学推理进行基准测试

人工智能 2026-01-15 v1

摘要

科学推理不仅依赖于逻辑推断,还依赖于激活先验知识和经验结构。记忆可以高效地复用知识,并增强推理的一致性和稳定性。然而,现有的基准测试主要评估最终答案或逐步连贯性,忽略了人类推理背后的记忆驱动机制,该机制涉及激活锚点和吸引子,然后将它们整合到多步推断中。为了弥补这一空白,我们提出了 A3A^3-Bench https://a3-bench.github.io,这是一个旨在通过双尺度记忆驱动激活来评估科学推理的基准测试,其基础是锚点与吸引子激活。首先,我们使用 SAPM 过程(主体、锚点与吸引子、问题和记忆发展)跨领域标注了 2,198 个科学推理问题。其次,我们引入了一个利用锚点和吸引子的双尺度记忆评估框架,以及用于衡量记忆激活率的 AAUI(锚点-吸引子利用率指数)指标。最后,通过对各种基础模型和范式的实验,我们验证了 A3A^3-Bench 并分析了记忆激活如何影响推理性能,为记忆驱动的科学推理提供了见解。

关键词

引用

@article{arxiv.2601.09274,
  title  = {$A^3$-Bench: Benchmarking Memory-Driven Scientific Reasoning via Anchor and Attractor Activation},
  author = {Jian Zhang and Yu He and Zhiyuan Wang and Zhangqi Wang and Kai He and Fangzhi Xu and Qika Lin and Jun Liu},
  journal= {arXiv preprint arXiv:2601.09274},
  year   = {2026}
}