在标签稀缺下预训练深度模型于学习排序中优于GBDTs
机器学习
2025-09-25 v5 人工智能
摘要
在表格数据上,大量文献表明当前深度学习(DL)模型至多表现与梯度提升决策树(GBDTs)相当,且在离群数据上显著逊于后者。然而,这些工作常研究理想化的问题设定,可能未能捕捉真实场景的复杂性。我们指出了一个DL模型可优于GBDTs的自然表格数据设定:标签稀缺下的表格学习排序(LTR)。包括搜索与推荐在内的表格LTR应用常拥有大量无标签数据与稀缺标签数据。我们展示DL排序器可利用无监督预训练来利用这些无标签数据。在公开与专有数据集的广泛实验中,我们表明预训练DL排序器在排序指标上持续优于GBDT排序器——有时高出38%——无论在总体还是离群点上皆然。
引用
@article{arxiv.2308.00177,
title = {Pretrained deep models outperform GBDTs in Learning-To-Rank under label scarcity},
author = {Charlie Hou and Kiran Koshy Thekumparampil and Michael Shavlovsky and Giulia Fanti and Yesh Dattatreya and Sujay Sanghavi},
journal= {arXiv preprint arXiv:2308.00177},
year = {2025}
}
备注
Published in TMLR, ICML-MFPL 2023 Workshop Oral, SPIGM@ICML2024