NewsEmbed:通过预训练文档表示对新闻进行建模
计算与语言
2021-06-08 v2 信息检索
机器学习
摘要
在文档级别对新闻文章等富含文本的新鲜内容进行有效建模是一个具有挑战性的问题。为确保基于内容的模型能很好地泛化到广泛应用,关键在于拥有一个规模超出人工标注量级且能达到所需质量的训练数据集。在这项工作中,我们提出了一种以极少人工监督挖掘语义相关新鲜文档及其主题标签的新方法,以应对这两个挑战。同时,我们设计了一个名为 NewsEmbed 的多任务模型,该模型交替训练对比学习与多标签分类,以推导出一个通用文档编码器。我们表明,所提方法可提供数十亿高质量自然训练样本,并且可自然扩展到多语言设置,其中不同语言的文本被编码于同一语义空间中。我们通过实验证明了 NewsEmbed 在多个自然语言理解任务(包括有监督与无监督)上具有竞争力。
引用
@article{arxiv.2106.00590,
title = {NewsEmbed: Modeling News through Pre-trained Document Representations},
author = {Jialu Liu and Tianqi Liu and Cong Yu},
journal= {arXiv preprint arXiv:2106.00590},
year = {2021}
}
备注
Accepted in SIGKDD 2021