中文

多轮强化学习中的稀疏-稠密信号调和:工业销售代理的双时间尺度信用分配

人工智能 2026-03-03 v1

摘要

优化大型语言模型用于工业销售需要在长期商业目标(例如转化率)与immediate linguistic约束(如流畅性和合规性)之间进行平衡。传统强化学习方法通常将这些异构目标合并到单一奖励中,导致高潮级奖励淹没较细微的回合级信号,从而导致训练不稳定或奖励被篡改。为解决此问题,我们提出了双时间尺度信用分配(DuCA)框架,通过分离不同时间尺度的优化。其核心是基于时间独立的优势归一化(HIAN),该方法在融合前分别归一化来自回合级和会话级奖励的优势,确保来自immediate和长期目标的梯度贡献在政策更新中得到平衡。针对高保真用户模拟器进行大量实验表明,DuCA 在转化率上相对提升了 6.82%,显著降低了 inter-sentence repetition 率的 82.28%,并降低了 identity 检测率的 27.35%,表明该方法在平衡战略性能与自然语言生成双重需求的工业销售场景中取得了显著改进。

关键词

引用

@article{arxiv.2603.01481,
  title  = {Harmonizing Dense and Sparse Signals in Multi-turn RL: Dual-Horizon Credit Assignment for Industrial Sales Agents},
  author = {Haojin Yang and Ai Jian and Xinyue Huang and Yiwei Wang and Weipeng Zhang and Ke Zeng and Xunliang Cai and Jingqing Ruan},
  journal= {arXiv preprint arXiv:2603.01481},
  year   = {2026}
}

备注

15 pages, 6 figures