中文

利用辅助知识图谱在 $d \gg n$ 时实现表格深度学习

机器学习 2023-06-09 v1 人工智能

摘要

机器学习模型在具有大量标注样本的数据集上表现出强劲性能。然而,对于具有极高 dd 维特征但有限 nn 个样本(即 dnd \gg n)的表格数据集,机器学习模型由于过拟合风险而难以取得强劲性能。此处我们的核心见解是,通常存在丰富的、描述输入特征的辅助领域信息,其可结构化为异质知识图谱(KG)。我们提出 PLATO,一种通过使用描述输入特征的辅助 KG 来正则化多层感知机(MLP)从而在 dnd \gg n 的表格数据上取得强劲性能的方法。在 PLATO 中,每个输入特征对应于辅助 KG 中的一个节点。在 MLP 的第一层中,每个输入特征也对应于一个权重向量。PLATO 基于如下归纳偏置:在辅助 KG 中对应于相似节点的两个输入特征,其在 MLP 第一层中应具有相似的权重向量。PLATO 通过可训练的消息传递函数从 KG 中相应节点推断每个输入特征的权重向量,从而捕捉该归纳偏置。在 6 个 dnd \gg n 数据集上,PLATO 以最高 10.19% 的优势超越 13 个最先进基线。

关键词

引用

@article{arxiv.2306.04766,
  title  = {Enabling tabular deep learning when $d \gg n$ with an auxiliary knowledge graph},
  author = {Camilo Ruiz and Hongyu Ren and Kexin Huang and Jure Leskovec},
  journal= {arXiv preprint arXiv:2306.04766},
  year   = {2023}
}