中文

TwiSTAR:快思考、慢思考、再行动,具有自适应推理的生成式推荐

信息检索 2026-05-13 v1

摘要

基于语义 ID(SID)的生成式推荐已成为一种有前景的范式,然而现有方法对所有用户历史统一应用固定的推理策略,要么是快速的直接生成,要么是缓慢的思维链推理。这种方法造成了一种权衡:快速推荐模型在困难样本上产生次优精度,而总是调用慢速推理则会导致过高的延迟,并在简单案例上浪费计算资源。为了解决这个问题,我们提出了“快思考、慢思考、再行动”框架,该框架学习为每个用户序列自适应地分配推理工作量。我们的系统为 LLM 配备了三个互补工具:一个基于 SID 的快速检索器、一个轻量级候选排序器,以及一个在推荐前生成显式理由的慢速推理模型。至关重要的是,我们通过将物品间知识转化为自然语言解释,向慢速模型注入了协同常识。一个通过监督预热和后续智能体强化学习训练得到的规划器,动态决定调用哪个工具。在三个数据集上的实验表明,我们的方法优于强基线,在实现一致精度提升的同时,相比统一慢速推理降低了推理延迟。

关键词

引用

@article{arxiv.2605.11553,
  title  = {TwiSTAR:Think Fast, Think Slow, Then Act,Generative Recommendation with Adaptive Reasoning},
  author = {Shiteng Cao and Kaian Jiang and Yunlong Gong and Zhiheng Li},
  journal= {arXiv preprint arXiv:2605.11553},
  year   = {2026}
}

备注

16pages,3 figures