中文

工业搜索中多轮对话的主动引导

计算与语言 2025-06-02 v1 信息检索

摘要

大型语言模型(LLM)的发展显著推进了多轮对话系统,凸显了主动引导对于增强用户交互的必要性。然而,这些系统在动态适应用户目标转变以及为实时交互保持低延迟方面面临挑战。在百度搜索 AI 助手这一工业级多轮搜索系统中,我们提出了一个新颖的两阶段框架来提供主动引导。第一阶段,目标自适应监督微调(G-SFT),采用一个目标自适应代理,动态适应用户目标转变并提供与目标相关的上下文信息。G-SFT 还结合了可扩展的知识转移,将 LLM 的洞察蒸馏到一个轻量级模型中,以实现实时交互。第二阶段,面向点击的强化学习(C-RL),采用生成-排序范式,从用户点击信号中系统性地构建偏好对,并通过更具吸引力的引导主动提高点击率。这种双阶段架构实现了互补目标:G-SFT 确保准确的目标跟踪,而 C-RL 通过点击信号驱动的强化学习优化交互质量。大量实验表明,我们的框架在离线评估中实现了 86.10% 的准确率(比基线高 23.95%),在在线部署中实现了 25.28% 的点击率(相对提升 149.06%),同时通过可扩展的知识蒸馏将推理延迟降低了 69.55%。

关键词

引用

@article{arxiv.2505.24251,
  title  = {Proactive Guidance of Multi-Turn Conversation in Industrial Search},
  author = {Xiaoyu Li and Xiao Li and Li Gao and Yiding Liu and Xiaoyang Wang and Shuaiqiang Wang and Junfeng Wang and Dawei Yin},
  journal= {arXiv preprint arXiv:2505.24251},
  year   = {2025}
}

备注

ACL'25 (Industry)