中文

面向语言模型推理的 HiFloat4 格式

机器学习 2026-02-16 v2 人工智能 硬件体系结构

摘要

本文介绍了 HiFloat4 (HiF4),一种专为深度学习设计的块浮点数据格式。每个 HiF4 单元打包 64 个 4 位元素,搭配 32 位共享缩放元数据,平均每个值占 4.5 位。该元数据指定三级缩放层次,捕捉组内外动态范围,提高了表示空间的利用率。此外,较大的 64 元素组大小使矩阵乘法能够以高度固定点方式执行,显著降低硬件面积和功耗。为评估所提出的格式,我们在包括 LLaMA、Qwen、Mistral、DeepSeek-V3.1 和 LongCat 在内的几种语言模型上进行了推理实验。结果表明,HiF4 在多种模型和多样化下游任务上,平均准确率高于最先进的 NVFP4 格式。

关键词

引用

@article{arxiv.2602.11287,
  title  = {HiFloat4 Format for Language Model Inference},
  author = {Yuanyong Luo and Jing Huang and Yu Cheng and Ziwei Yu and Kaihua Tang and Xinda Ma and Xin Wang and Anping Tong and Guipeng Hu and Yun Xu and Mehran Taghian and Peng Wu and Guanglin Li and Yunke Peng and Tianchi Hu and Minqi Chen and Michael Bi Mi and Hu Liu and Xiping Zhou and Junsong Wang and Qiang Lin and Heng Liao},
  journal= {arXiv preprint arXiv:2602.11287},
  year   = {2026}
}

备注

8 pages, 4 figures