中文

利用投机解码加速 PayPal 商业智能体:基于微调 Nemotron 模型的 EAGLE3 实证研究

机器学习 2026-04-23 v1 人工智能

摘要

我们评估了将 EAGLE3 投机解码作为 PayPal 商业智能体的推理时优化方案,该智能体由微调的 llama3.1-nemotron-nano-8B-v1 模型驱动。在先前工作(NEMO-4-PAYPAL)通过领域特定微调降低延迟和成本的基础上,我们在相同的 2xH100 硬件上通过 vLLM 对 EAGLE3 与 NVIDIA NIM 进行了基准测试,测试涵盖 40 种配置,包括投机 token 数量(gamma=3,gamma=5)、并发级别(1-32)和采样温度(0,0.5)。主要发现:(1)gamma=3 在零额外硬件成本下实现了 22-49% 的吞吐量提升和 18-33% 的延迟降低;(2)在所有条件下,gamma=3 的接受率保持稳定,约为 35.5%;(3)gamma=5 的收益递减(接受率约为 25%);(4)LLM-as-Judge 评估确认输出质量得到完全保留;(5)在单张 H100 上的投机解码性能与在两张 H100 上的 NIM 相当或更优,从而实现 50% 的 GPU 成本降低。

关键词

引用

@article{arxiv.2604.19767,
  title  = {Accelerating PayPal's Commerce Agent with Speculative Decoding: An Empirical Study on EAGLE3 with Fine-Tuned Nemotron Models},
  author = {Ally Qin and Jian Wan and Sarat Mudunuri and Srinivasan Manoharan},
  journal= {arXiv preprint arXiv:2604.19767},
  year   = {2026}
}