TrackRec:通过偏好对齐实现迭代交替反馈与思维链的推荐系统
信息检索
2025-08-22 v1
摘要
大型语言模型(LLMs)广泛的世界知识和强大的推理能力在推荐系统(RS)中引起了极大关注。具体而言,思维链(CoT)已被证明能提高LLMs在RS复杂推理任务上的性能。然而,由于LLMs经常存在幻觉问题,无法保证其推理CoT是有效的。一个关键挑战是如何通过有效的CoT推理进一步增强LLMs的推荐能力。因此,我们提出了TrackRec,一个旨在增强LLMs在RS中推理能力的框架。TrackRec专注于利用LLMs的知识准确推断用于用户偏好的推荐CoT(RecCoT)。该RecCoT既可以作为LLM完成推荐任务的解释,也可以作为辅助特征帮助推荐模型完成推荐任务。TrackRec由一个RecCoT生成器(G)和一个RecCoT验证器(V)组成。此外,我们设计了交替反馈学习机制,使G通过来自V的反馈进行直接偏好优化,以生成与V标准对齐的、越来越准确的RecCoT。同时,V利用来自G的推理反馈进行微调,以增强其与推荐任务对齐的验证能力。通过G和V之间的迭代交替反馈学习,TrackRec持续提升G的用户偏好分析能力和V的验证能力。大量实验证明了我们方法的有效性,表明其超越了最先进的方法。此外,TrackRec已部署在一个拥有数亿用户的大型广告平台上,并取得了显著收益。
引用
@article{arxiv.2508.15388,
title = {TrackRec: Iterative Alternating Feedback with Chain-of-Thought via Preference Alignment for Recommendation},
author = {Yu Xia and Rui Zhong and Zeyu Song and Wei Yang and Junchen Wan and Qingpeng Cai and Chi Lu and Peng Jiang},
journal= {arXiv preprint arXiv:2508.15388},
year = {2025}
}