用于流式文档及其内容联合表示的分层神经语言模型
计算与语言
2016-06-29 v1 信息检索
摘要
我们考虑在数据流中学习文档的分布式表示问题。文档被表示为低维向量,并使用包含两个嵌入式神经语言模型的分层框架与词标记的分布式向量表示进行联合学习。具体而言,我们利用流中文档的上下文,使用其中一个语言模型对文档序列进行建模,另一个对文档内的词序列进行建模。这些模型为词标记和文档学习连续向量表示,使得语义相似的文档和词在共同的向量空间中彼此接近。我们讨论了模型的扩展,通过在层次结构中添加进一步的用户层,可以应用于个性化推荐和社交关系挖掘,从而学习特定于用户的向量以表示个人偏好。我们在来自 MovieLens 的公开电影评分数据集以及包含在 Yahoo 服务器上收集的三个月用户活动日志的大规模 Yahoo News 数据上验证了所学习的表示。结果表明,所提出的模型可以学习文档和词标记的有用表示,大幅优于当前的最先进水平。
引用
@article{arxiv.1606.08689,
title = {Hierarchical Neural Language Models for Joint Representation of Streaming Documents and their Content},
author = {Nemanja Djuric and Hao Wu and Vladan Radosavljevic and Mihajlo Grbovic and Narayan Bhamidipati},
journal= {arXiv preprint arXiv:1606.08689},
year = {2016}
}
备注
24th International World Wide Web Conference