企业级搜索:加速稀疏极端多标签排序树的推理
机器学习
2022-02-25 v3
摘要
基于树的模型因其亚线性推理时间而支撑着许多现代语义搜索引擎和推荐系统。在工业应用中,这些模型在极端规模下运行,其中每一丝性能都至关重要。极端规模下的内存约束也要求模型是稀疏的,因此基于树的模型通常由稀疏矩阵代数例程作为后端。然而,目前尚无专门针对极端多标签排序/分类(XMR/XMC)问题中基于树的模型所遇到的稀疏结构的稀疏矩阵技术。为解决此问题,我们提出了掩码稀疏分块乘法(MSCM)技术,一种专为 XMR 树定制的稀疏矩阵技术。MSCM 易于实现、可极度并行化,并能以零成本显著加速任何现有的树推理流水线。我们对应用于若干不同稀疏推理方案的 MSCM 进行了全面研究,并在通用极端多标签排序框架上对我们的方法进行了基准测试。我们观察到,MSCM 在在线和批量推理设置、单线程和多线程设置以及许多不同的树模型和数据集上均带来了一致的大幅加速。为展示其在工业应用中的效用,我们将 MSCM 应用于一个拥有 1 亿产品的企业级语义产品搜索问题,并在单线程上实现了每查询 0.88 毫秒的亚毫秒延迟——相较原始推理技术延迟降低了 8 倍。MSCM 技术完全不需要牺牲模型精度,因为它给出的结果与标准稀疏矩阵技术完全相同。因此,我们相信 MSCM 将使 XMR 树的用户能够以极低成本在其推理流水线中节省大量计算资源。
引用
@article{arxiv.2106.02697,
title = {Enterprise-Scale Search: Accelerating Inference for Sparse Extreme Multi-Label Ranking Trees},
author = {Philip A. Etter and Kai Zhong and Hsiang-Fu Yu and Lexing Ying and Inderjit Dhillon},
journal= {arXiv preprint arXiv:2106.02697},
year = {2022}
}