中文

TADT-CSA:基于对比状态抽象的时间优势决策变换器用于生成式推荐

信息检索 2025-08-19 v2

摘要

随着基于变换器的大型语言模型(LLM)的快速发展,生成式推荐在提升现代推荐系统的准确度和语义理解方面展现出巨大潜力。相较于 LLM,决策变换器(DT)是一种应用于序列推荐任务的轻量级生成模型。然而,DT 在轨迹拼接方面面临挑战,常产生次优轨迹。此外,鉴于用户状态的高维度和推荐场景中庞大的状态空间,DT 会产生显著的计算成本,并难以学习有效的状态表示。为克服这些问题,我们提出一种新的时间优势决策变换器(TADT)结合对比状态抽象(CSA)模型。具体而言,我们将常规的 Return-To-Go(RTG)信号与一种新颖的时间优势(TA)信号相结合,后者鼓励模型捕捉长期回报及其序列趋势。进一步地,我们将对比状态抽象模块集成到 DT 框架中,以学习更有效和更具表达力的状态表示。在该模块中,我们引入 TA 条件状态向量量化(TAC-SVQ)策略,其中 TA 分数引导状态词汇表融合上下文 token 信息。此外,还采用奖励预测网络和对比转移预测(CTP)网络,以确保状态词汇表保留当前状态的奖励信息以及相邻状态之间的转移信息。在公共数据集和在线推荐系统上的实证结果表明,TADT-CSA 模型有效且优于基线方法。

关键词

引用

@article{arxiv.2507.20327,
  title  = {TADT-CSA: Temporal Advantage Decision Transformer with Contrastive State Abstraction for Generative Recommendation},
  author = {Xiang Gao and Tianyuan Liu and Yisha Li and Jingxin Liu and Lexi Gao and Xin Li and Haiyang Lu and Liyin Hong},
  journal= {arXiv preprint arXiv:2507.20327},
  year   = {2025}
}