中文

DistDNAS:两小时内搜索高效特征交互

信息检索 2025-03-26 v2 机器学习

摘要

搜索效率与服务效率是推荐系统中构建特征交互并加速模型开发过程的两个主要维度。在大规模基准上,由于对海量数据的顺序工作流,搜索最优特征交互设计需要高昂成本。此外,融合不同来源、阶数与数学运算的交互会给推荐模型带来潜在冲突与额外冗余,导致性能与服务成本之间的次优权衡。本文中,我们提出 DistDNAS 作为一种简洁方案,以快速高效地酿造特征交互设计。DistDNAS 提出一个超网,将不同阶数与类型的交互模块作为搜索空间纳入其中。为优化搜索效率,DistDNAS 分布搜索并聚合不同数据日期上最优交互模块的选择,实现超过 25 倍的加速并将搜索成本从 2 天降至 2 小时。为优化服务效率,DistDNAS 引入可微分成本感知损失以惩罚冗余交互模块的选择,提升所发现特征交互在服务中的效率。我们在 1TB Criteo Terabyte 数据集上广泛评估由 DistDNAS 精制的最佳模型。实验评估显示相较当前最先进的 CTR 模型取得了 0.001 AUC 提升与 60% FLOPs 节省。

关键词

引用

@article{arxiv.2311.00231,
  title  = {DistDNAS: Search Efficient Feature Interactions within 2 Hours},
  author = {Tunhou Zhang and Wei Wen and Igor Fedorov and Xi Liu and Buyun Zhang and Fangqiu Han and Wen-Yen Chen and Yiping Han and Feng Yan and Hai Li and Yiran Chen},
  journal= {arXiv preprint arXiv:2311.00231},
  year   = {2025}
}