OnePred:基于递归意图记忆的下一查询预测技术
计算与语言
2026-05-25 v1 人工智能
摘要
尽管大型语言模型(LLM)对话系统每日处理数百万次多轮对话,但它们仍然是根本性的反应式系统:仅在用户输入查询后才作出响应。向主动交互迈出的关键一步是下一查询预测,即仅凭前序对话预测用户的后续查询。本任务的进展受限于缺乏专门基准和效率-质量之间的根本权衡:粗暴拼接完整对话历史导致令牌消耗线性增长,而截断至最新一轮则丢弃关键的跨轮上下文。我们的关键洞见是:准确预测无需重新读取原始历史;仅需追踪用户在主题、未解决需求和兴趣转变方面的意图轨迹。我们提出了 OnePred,通过递归更新的记忆作为唯一的跨轮上下文,将每轮成本独立于对话长度。我们通过两个阶段的强化学习训练管道来实现,该管道首先教会模型预测什么,然后教会模型压缩什么,塑造出面向预测的意图链。为建立严谨的测试基准,我们引入了 NQP-Bench,涵盖三个多样化子集。实验表明,OnePred 在预测质量上始终优于所有基线方法,同时将每轮令牌消耗降低最高可达 22 倍,尤其在较长对话中获得更大收益。我们的代码已公开于 https://github.com/ZBWpro/OnePred。
引用
@article{arxiv.2605.23668,
title = {OnePred: Next-Query Prediction via Recursive Intent Memory in Multi-Turn Conversations},
author = {Jiangwang Chen and Bowen Zhang and Zixin Song and Jiazheng Kang and Xiao Yang and Da Zhu and Guanjun Jiang},
journal= {arXiv preprint arXiv:2605.23668},
year = {2026}
}