中文

AI-mediated教育中的推理能耗与延迟:基于边缘与云模型的学习-焦耗分析

计算机与社会 2026-03-24 v1 人工智能 机器学习

摘要

及时反馈是有效AI-mediated学习的基础要求,但交付其能耗和延迟成本至今鲜为人知。本研究通过对Microsoft Phi-3 Mini(4k-instruct)两个设备端推理配置在NVIDIA T4 GPU上的实证比较,探讨AI辅导中的延迟-能耗-学习权衡。两种配置分别为全精度FP16和4位NormalFloat(NF4)量化。两者均在KV-cache启用下的推理中评估了500个教育提示,涵盖五个中学学科领域。教育响应的教学质量由混合面板的10名剑桥国际教师和三台前沿AI系统根据四维评分表进行评估。我们引入学习-焦耗(Learning-per-Watt, LpW),作为衡量学习者等待窗口内单位能耗所带来教学价值的新指标。在现实部署下,NF4在能耗上优于FP16(329焦耳 vs. 369焦耳),但延迟更高(13.4秒 vs. 9.2秒),在L pW上为FP16带来了有限的优势,为0.19分的质量差异。若禁用缓存进行推理——即离线评估中使用但不出现在实际部署中——差距扩大至7.4倍,显著高估了FP16的优势超过五倍。量化效率取决于硬件和推理场景,对于低资源环境中均等的AI辅导部署具有重大意义。

关键词

引用

@article{arxiv.2603.20223,
  title  = {Inference Energy and Latency in AI-Mediated Education: A Learning-per-Watt Analysis of Edge and Cloud Models},
  author = {Kushal Khemani},
  journal= {arXiv preprint arXiv:2603.20223},
  year   = {2026}
}