NEZHA:面向生成式推荐的零损耗和高速解码架构
人工智能
2026-02-04 v2 机器学习
摘要
生成式推荐(GR)由大型语言模型(LLM)驱动,代表了工业级推荐系统的新兴范式。然而,其实际应用严重受限于高推理延迟,使其无法用于高吞吐量的实时服务,限制了整体业务影响。虽然已提出预测性解码(SD)以加速自回归生成过程,但现有实现引入了新的瓶颈:通常需要独立的草稿模型和基于模型的验证器,需额外训练且增加延迟开销。本文通过NEZHA架构解决了这些挑战,构建一种为GR系统实现零损耗和高速解码的新型架构。具体而言,NEZHA将一个轻量级自回归草稿头集成到主模型中,实现高效自草拟。这种设计结合特定的输入提示结构,保留了序列到序列生成的完整性。此外,为解决主要来源于幻觉的严重性能下降问题,本文引入一种基于哈希集合的高效、无模型验证器。我们通过在公开数据集上的大规模实验展示了NEZHA的有效性,并已于2025年10月在淘宝上成功部署,推动了数十亿级广告收入,服务了数亿活跃用户。
引用
@article{arxiv.2511.18793,
title = {NEZHA: A Zero-sacrifice and Hyperspeed Decoding Architecture for Generative Recommendations},
author = {Yejing Wang and Shengyu Zhou and Jinyu Lu and Ziwei Liu and Langming Liu and Maolin Wang and Wenlin Zhang and Feng Li and Wenbo Su and Pengjie Wang and Jian Xu and Xiangyu Zhao},
journal= {arXiv preprint arXiv:2511.18793},
year = {2026}
}