中文

LiveThinking:基于强化学习实现AI直播实时高效推理

机器学习 2025-10-10 v1 计算与语言

摘要

在AI驱动的电商直播中,数字化身需要实时响应以提升用户参与度,而高延迟的大型推理模型 (LRM) 难以满足这一需求。我们提出LiveThinking,一个实用的两阶段优化框架,以弥补这一差距。首先,我们通过拒绝采样精调 (RFT) 将670B参数的教师LRM蒸馏为轻量级30B混合专家 (MoE) 模型(实际激活3B参数),以降低部署成本,但保留教师模型中冗长的推理过程导致延迟问题。为解决此问题,第二阶段采用基于组相对策略优化 (GRPO) 的强化学习方法压缩模型推理路径,同时通过多目标奖励函数平衡正确性、有用性和简洁性。LiveThinking实现了计算成本约30倍的降低,使其能够实现亚秒级延迟。在淘宝直播平台上,其使响应正确性提升3.3%,有用性提升21.8%。该系统经过数十万观众测试,显著提升了Gross Merchandise Volume (GMV),证明了其在提升用户体验和商业表现方面的有效性。

关键词

引用

@article{arxiv.2510.07685,
  title  = {LiveThinking: Enabling Real-Time Efficient Reasoning for AI-Powered Livestreaming via Reinforcement Learning},
  author = {Yuhan Sun and Zhiwei Huang and Wanqing Cui and Shaopan Xiong and Yazhi Guo and Meiguang Jin and Junfeng Ma},
  journal= {arXiv preprint arXiv:2510.07685},
  year   = {2025}
}

备注

12 pages, 8 figures