FIVES:面向大规模表格数据通过边搜索的特征交互
机器学习
2021-06-03 v2 机器学习
摘要
高阶交互特征捕捉不同列之间的相关性,因此有希望增强 ubiquitous 表格数据上的各种学习任务。为自动化生成交互特征,现有工作要么显式遍历特征空间,要么通过某些设计模型的中间激活隐式表达交互。这两类方法表明,在特征可解释性与搜索效率之间本质上存在权衡。为兼具二者优点,我们提出一种名为通过边搜索的特征交互(FIVES)的新方法,其将交互特征生成任务表述为在定义的特征图上搜索边。具体而言,我们首先给出理论依据,激励我们以递增阶数搜索有用交互特征。然后我们通过优化专用的图神经网络(GNN)以及与所定义特征图相关的邻接张量来实例化该搜索策略。如此,所提FIVES方法将耗时的遍历简化为GNN的典型训练过程,并能够根据学到的邻接张量实现显式特征生成。在基准和真实世界数据集上的实验结果显示了FIVES相对于几种最先进方法的优势。此外,FIVES识别的交互特征已部署于全球领先电商平台淘宝的推荐系统。在线A/B测试的结果进一步验证了所提FIVES方法的有效性,并且我们进一步将FIVES作为AI实用工具提供给阿里云的客户。
引用
@article{arxiv.2007.14573,
title = {FIVES: Feature Interaction Via Edge Search for Large-Scale Tabular Data},
author = {Yuexiang Xie and Zhen Wang and Yaliang Li and Bolin Ding and Nezihe Merve Gürel and Ce Zhang and Minlie Huang and Wei Lin and Jingren Zhou},
journal= {arXiv preprint arXiv:2007.14573},
year = {2021}
}
备注
Accepted by KDD-21