面向最优且可解释表示空间重构的分组强化特征生成
机器学习
2022-05-31 v1 人工智能
摘要
表示(特征)空间是一个将数据点向量化、计算距离、刻画模式并嵌入几何结构的环境。提取良好的表示空间对于应对维数灾难、提升模型泛化能力、克服数据稀疏性以及增加经典模型的可用性至关重要。现有文献,如特征工程与表示学习,在实现完全自动化(例如过度依赖繁重人力与经验)、可解释显式性(例如可追踪的重构过程与可解释的新特征)以及灵活最优性(例如最优特征空间重构未嵌入下游任务)方面存在局限。我们能否同时应对机器学习任务中表示空间重构的自动化、显式性与最优性挑战?为回答此问题,我们提出分组强化生成视角。我们将表示空间重构重新表述为嵌套特征生成与选择的交互过程,其中特征生成旨在生成新的有意义且显式的特征,特征选择旨在消除冗余特征以控制特征规模。我们开发了一种级联强化学习方法,利用三个级联马尔可夫决策过程学习最优生成策略,以自动化特征与操作的选择及特征交叉。我们设计了一种分组生成策略,交叉一个特征组、一个操作与另一个特征组来生成新特征,并找出能提升探索效率与增强级联智能体奖励信号的策略。最后,我们给出广泛实验以证明我们系统的有效性、高效性、可追踪性与显式性。
引用
@article{arxiv.2205.14526,
title = {Group-wise Reinforcement Feature Generation for Optimal and Explainable Representation Space Reconstruction},
author = {Dongjie Wang and Yanjie Fu and Kunpeng Liu and Xiaolin Li and Yan Solihin},
journal= {arXiv preprint arXiv:2205.14526},
year = {2022}
}
备注
KDD 2022