ELIAS:面向大输出空间的端到端学习与索引搜索方法
机器学习
2023-01-11 v2 信息检索
摘要
极端多标签分类(XMC)是一种流行的框架,用于解决许多需要从非常大量的潜在输出选项中进行准确预测的现实世界问题。处理大标签空间的一种流行方法是将标签排列成浅层基于树的索引,然后学习一个机器学习模型以通过束搜索高效地搜索该索引。现有方法基于预定义特征将标签空间聚类为若干互斥簇来初始化树索引,并在整个训练过程中保持固定。这种方法导致标签空间上的次优索引结构,并将搜索性能限制于索引初始化时所做选择的质量。在本文中,我们提出一种新方法 ELIAS,它将基于树的索引松弛为一种专门的基于加权图的索引,并与最终任务目标端到端联合学习。更具体地说,ELIAS 将现有基于树的索引中的离散簇到标签分配建模为可软学习的参数,这些参数与机器学习模型的其余部分联合学习。ELIAS 在多个具有数百万标签的大规模极端分类基准上取得了最先进的性能。特别地,ELIAS 在 precision@1 上可比现有 XMC 方法高出至多 2.5%,在 recall@100 上高出至多 4%。ELIAS 的 PyTorch 实现及其他资源可在 https://github.com/nilesh2797/ELIAS 获取。
引用
@article{arxiv.2210.08410,
title = {ELIAS: End-to-End Learning to Index and Search in Large Output Spaces},
author = {Nilesh Gupta and Patrick H. Chen and Hsiang-Fu Yu and Cho-Jui Hsieh and Inderjit S Dhillon},
journal= {arXiv preprint arXiv:2210.08410},
year = {2023}
}
备注
21 pages, 9 figures, NeurIPS 2022 camera-ready publication