基于多任务学习的用户因子自适应用户嵌入
计算与语言
2021-02-23 v1 机器学习
摘要
社交媒体数据中的语言因用户及其感兴趣领域而异:用户在其不同兴趣下撰写的词语可能具有不同含义(如 cool)或情感(如 fast)。然而,大多数现有的用户嵌入训练方法忽略了用户兴趣(如产品或电影类别,例如剧情片 vs. 动作片)之间的变异。在本研究中,我们将用户兴趣视为领域,并实证考察在三个英文社交媒体数据集中用户语言如何随用户因子变化。随后我们提出一种用户嵌入模型,通过多任务学习框架来刻画用户兴趣的语言变异性。该模型在无人工监督下学习用户语言及其变异。已有工作主要通过外部任务评估用户嵌入,我们则提出一种基于聚类的内在评估,并通过文本分类这一外部任务评估用户嵌入。在三个英文社交媒体数据集上的实验表明,我们的方法通过自适应用户因子通常优于基线方法。
引用
@article{arxiv.2102.11103,
title = {User Factor Adaptation for User Embedding via Multitask Learning},
author = {Xiaolei Huang and Michael J. Paul and Robin Burke and Franck Dernoncourt and Mark Dredze},
journal= {arXiv preprint arXiv:2102.11103},
year = {2021}
}
备注
Accepted in the Second Workshop on Domain Adaptation for Natural Language Processing (Adapted-NLP)