OutRank:利用基数感知特征排序加速面向大型稀疏数据集的基于 AutoML 的模型搜索
信息检索
2023-09-06 v1 人工智能
机器学习
摘要
现代推荐系统的设计依赖于理解特征空间中哪些部分与解决给定推荐任务相关。然而,该领域的真实世界数据集通常具有规模大、稀疏和噪声的特点,使得识别有意义信号十分困难。特征排序代表了一类高效算法,可通过识别信息量最大的特征并促进对更紧凑且性能更优的模型(AutoML)的自动化搜索来应对这些挑战。我们提出 OutRank,一个用于通用特征排序与数据质量相关异常检测的系统。OutRank 以类别型数据为核心构建,利用一种相对于相同基数特征所产生的噪声进行归一化的互信息变体。我们进一步通过纳入特征相似性与组合相关性信息来扩展该相似性度量。所提方法的可行性通过在无性能损失情况下加速最先进 AutoML 系统在合成数据集上的运行得到证明。此外,我们考虑了一个真实点击率预测数据集,其性能优于随机森林等强基线方法。所提方法能够探索比仅用 AutoML 的方法大至多 300% 的特征空间,从而在现成硬件上更快搜索更优模型。
引用
@article{arxiv.2309.01552,
title = {OutRank: Speeding up AutoML-based Model Search for Large Sparse Data sets with Cardinality-aware Feature Ranking},
author = {Blaž Škrlj and Blaž Mramor},
journal= {arXiv preprint arXiv:2309.01552},
year = {2023}
}
备注
accepted to RecSys2023