流动性指数:下一代超级智能基准测试
计算与语言
2026-04-15 v2 人工智能
摘要
本文引入流动性指数(Fluidity Index, FI),以量化模型在动态、可扩展环境中的适应性。该基准测试基于初始、当前和未来环境状态之间的偏差来衡量响应准确性,评估上下文切换和连续性。我们区分了封闭式和开放式基准测试,优先考虑闭环开放式现实世界基准测试,以测试适应性。该方法衡量模型理解、预测和调整以应对可扩展环境中状态变化的能力。一个真正具有超级智能的模型应至少具备二阶适应性,能够通过数字补给实现自我维持的计算,以实现最佳流动性。
引用
@article{arxiv.2510.20635,
title = {Why Did Apple Fall: Evaluating Curiosity in Large Language Models},
author = {Haoyu Wang and Sihang Jiang and Yuyan Chen and Xiaojun Meng and Jiansheng Wei and Yitong Wang and Yanghua Xiao},
journal= {arXiv preprint arXiv:2510.20635},
year = {2026}
}
备注
ACL 2026 findings paper