中文

用于极端多标签文本分类的快速多分辨率 Transformer 微调

机器学习 2021-11-01 v2 人工智能 信息检索 机器学习

摘要

极端多标签文本分类(XMC)旨在从极大的标签集合中为给定文本输入找到相关标签。许多现实世界应用可以被表述为 XMC 问题,例如推荐系统、文档标注和语义搜索。最近,基于 transformer 的 XMC 方法,如 X-Transformer 和 LightXML,已显示出相对于其他 XMC 方法的显著改进。尽管利用预训练的 transformer 模型进行文本表示,但在大标签空间上 transformer 模型的微调过程即使使用强大的 GPU 仍具有冗长的计算时间。在本文中,我们提出一种新颖的递归方法 XR-Transformer,通过对一系列与原始 XMC 目标函数相关的多分辨率目标递归地微调 transformer 模型来加速该过程。实证结果表明,与其他基于 transformer 的 XMC 模型相比,XR-Transformer 训练时间显著更少,同时产生了更好的最先进结果。特别是在具有 300 万标签的公开 Amazon-3M 数据集上,XR-Transformer 不仅比 X-Transformer 快 20 倍,还将 Precision@1 从 51% 提高到 54%。

关键词

引用

@article{arxiv.2110.00685,
  title  = {Fast Multi-Resolution Transformer Fine-tuning for Extreme Multi-label Text Classification},
  author = {Jiong Zhang and Wei-cheng Chang and Hsiang-fu Yu and Inderjit S. Dhillon},
  journal= {arXiv preprint arXiv:2110.00685},
  year   = {2021}
}