中文

可溯源分组自优化特征变换学习:双优化视角

机器学习 2023-06-30 v1

摘要

特征变换旨在通过数学方式精炼现有特征,重构有效的表示空间。它是应对维数灾难、增强模型泛化、缓解数据稀疏以及拓展经典模型适用性的关键途径。现有研究主要聚焦于基于领域知识的特征工程或潜在表示学习。然而,这些方法虽有洞见,却缺乏完全自动化,且无法产生可溯源的最优表示空间。一个不可或缺的问题由此产生:在重构机器学习任务的特征空间时,我们能否同时应对这些局限?我们的初始工作通过引入一种新颖的自优化框架,向该挑战迈出了开创性一步。该框架利用三个级联的强化智能体自动选择候选特征与操作,以生成改进的特征变换组合。尽管取得了令人印象深刻的进展,其在效能与泛化能力上仍有提升空间。在本扩展期刊版中,我们从两个不同却互联的视角推进初始工作:1)我们提出对原框架的改进,其集成了基于图的状态表示方法以更有效地捕捉特征交互,并发展不同的Q-learning策略以进一步缓解Q值过高估计。2)我们采用一种新的优化技术(actor-critic)训练整个自优化框架,以加速模型收敛并提升特征变换性能。最后,为验证框架改进后效能与泛化能力,我们开展了大量实验并进行了全面分析。

关键词

引用

@article{arxiv.2306.16893,
  title  = {Traceable Group-Wise Self-Optimizing Feature Transformation Learning: A Dual Optimization Perspective},
  author = {Meng Xiao and Dongjie Wang and Min Wu and Kunpeng Liu and Hui Xiong and Yuanchun Zhou and Yanjie Fu},
  journal= {arXiv preprint arXiv:2306.16893},
  year   = {2023}
}

备注

21 pages, submitted to TKDD. arXiv admin note: text overlap with arXiv:2209.08044, arXiv:2205.14526