面向AI基础设施的统一指标架构:集成性能、效率与成本的跨层分类框架
综合经济学
2026-01-21 v4 经济学
摘要
大规模AI系统的增长受到基础设施限制的日益增多:电力供应限制、热管理和水资源约束、互联网规模化、内存压力、数据管道吞吐量以及生命周期成本的快速攀升。尽管这些约束在超大规模集群中相互作用,但主要指标仍然碎片化。现有指标从设施层面的(PUE)、机架功率密度到网络层面的(全归约延迟)、数据管道层面的以及财务层面的(TCO系列)指标,仅各自捕捉自身领域,无法提供物理、计算和经济约束如何相互作用的整体视图。这种碎片化掩盖了能源、计算与成本之间的结构性关系,阻碍了跨部门的协同优化,无法清晰地把握瓶颈如何产生、传播并共同决定AI基础设施的效率前沿。本文发展了一个集成框架,通过三域语义分类和六层架构分解,将这些零散指标整合起来,形成6×3的分类学,描绘了各部门如何在AI基础设施堆栈中进行传播。该分类学基于对所有具有经济和财务相关性指标的系统性综述和元分析,识别了最广泛使用的措施、其研究强度以及跨域相互依赖性。基于这一证据基础,Metric Propagation Graph(MPG)形式化了跨层依赖,实现系统范围内的解释、复合指标构建以及能源、碳排放和成本的多目标优化。该框架为基准测试、集群设计、容量规划和生命周期经济分析提供了一致的基础,通过将物理运行、计算效率和成本结果纳入统一的分析结构,实现了跨部门的协同优化。
引用
@article{arxiv.2511.21772,
title = {A Unified Metric Architecture for AI Infrastructure: A Cross-Layer Taxonomy Integrating Performance, Efficiency, and Cost},
author = {Qi He},
journal= {arXiv preprint arXiv:2511.21772},
year = {2026}
}