中文

从维基百科引导大规模细粒度上下文广告分类器

信息检索 2021-04-21 v2 机器学习

摘要

上下文广告为广告主提供了将其广告定向到最相关上下文的机会。然而,除非我们能使用细粒度类别(例如“coupe”对“hatchback”而非“automotive”对“sport”)来定向页面内容,否则其效力无法被充分利用。广泛使用的广告内容分类法(IAB 分类法)包含 23 个粗粒度类别和 355 个细粒度类别。由于类别数量庞大,收集训练文档以构建监督分类模型,或在基于规则的分类系统中编写专家规则都变得极具挑战。此外,在细粒度分类中,不同类别常相互重叠或共现,使准确分类更加困难。本工作中,我们提出 wiki2cat,一种通过利用维基百科类别图来解决大规模细粒度文本分类问题的方法。首先将 IAB 分类法中的类别映射到图中的类别节点,然后在图上传播标签以获得带标签的维基百科文档列表,从而诱导出文本分类器。该方法非常适合大规模分类问题,因为它不需要任何人工标注文档或手工整理的规则或关键词。所提方法与多种基于学习和基于关键字的基线进行了基准比较,在公开数据集及一个包含 300 多个细粒度类别的新数据集上均取得了有竞争力的性能。

关键词

引用

@article{arxiv.2102.06429,
  title  = {Bootstrapping Large-Scale Fine-Grained Contextual Advertising Classifier from Wikipedia},
  author = {Yiping Jin and Vishakha Kadam and Dittaya Wanvarie},
  journal= {arXiv preprint arXiv:2102.06429},
  year   = {2021}
}

备注

Accepted to TextGraphs-15 Workshop @ NAACL 2021