将多域预训练推荐彻底建模为语言
信息检索
2023-11-28 v3
摘要
随着预训练语言模型(PLM)在各种 NLP 任务中广泛得到验证,先驱性工作尝试探索 PLM 中通用文本信息与用户历史行为序列中个性化行为信息的潜在协作,以增强序列推荐(SR)。然而,尽管输入格式与任务目标存在共性,行为信息与文本信息之间仍存在巨大鸿沟,阻碍了通过 PLM 将 SR 彻底建模为语言建模。为弥合这一鸿沟,我们提出一种新颖的统一预训练语言模型增强的序列推荐(UPSR),旨在为多域推荐任务构建统一的预训练推荐模型。我们正式设计了五个关键指标,即自然性、域一致性、信息量、噪声与歧义以及文本长度,以在预训练与微调阶段分别指导文本-物品适配和行为序列-文本序列适配,这些指标至关重要但此前工作未充分探索。在实验中,我们在七个数据集上进行了包含微调与零样本设置的广泛评估,并取得了整体最优性能。全面的模型分析也为通过 PLM 进行行为建模提供了有价值的见解,为大型预训练推荐模型带来启示。源代码将于未来发布。
引用
@article{arxiv.2310.13540,
title = {Thoroughly Modeling Multi-domain Pre-trained Recommendation as Language},
author = {Zekai Qu and Ruobing Xie and Chaojun Xiao and Yuan Yao and Zhiyuan Liu and Fengzong Lian and Zhanhui Kang and Jie Zhou},
journal= {arXiv preprint arXiv:2310.13540},
year = {2023}
}