PTUM:基于自监督从无标注用户行为预训练用户模型
信息检索
2020-10-06 v1
摘要
用户建模对许多个性化网络服务至关重要。许多现有方法基于用户行为及目标任务的标注数据来建模用户。然而,这些方法无法利用无标注用户行为数据中的有用信息,且在标注数据稀缺时性能可能并非最优。受在大规模无标注语料上预训练以赋能诸多下游任务的语言模型(pre-trained language models)启发,本文提出从大规模无标注用户行为数据预训练用户模型。我们提出两个用于用户模型预训练的自监督任务:其一是掩码行为预测,可建模历史行为间的相关性;其二是接下来 个行为预测,可建模过去与未来行为间的相关性。预训练的用户模型在下游任务中微调,以学习任务特定的用户表示。在两个真实数据集上的实验结果验证了所提用户模型预训练方法的有效性。
引用
@article{arxiv.2010.01494,
title = {PTUM: Pre-training User Model from Unlabeled User Behaviors via Self-supervision},
author = {Chuhan Wu and Fangzhao Wu and Tao Qi and Jianxun Lian and Yongfeng Huang and Xing Xie},
journal= {arXiv preprint arXiv:2010.01494},
year = {2020}
}
备注
To appear in Findings of EMNLP 2020