中文

STUNT:利用未标记表格自生成任务的少样本表格学习

机器学习 2023-03-03 v1 人工智能

摘要

利用少量标记表格样本进行学习往往是工业机器学习应用的必要需求,因为各类表格数据面临高标注成本或难以为新任务收集新样本的问题。尽管极其重要,此类问题在表格学习领域甚少被探索,且来自其他领域的现有少样本学习方案由于表格数据的异质特性而难以直接应用。本文提出一个简单而有效的少样本半监督表格学习框架,称为从未标记表格自生成任务(STUNT)。我们的核心思想是通过将随机选择的列作为目标标签来自生成多样的少样本任务。随后我们采用元学习方案,利用所构造的任务学习可泛化知识。此外,我们引入一种无监督验证方案,通过使用 STUNT 从未标记数据生成伪验证集来进行超参数搜索(与早停)。实验结果表明,相较于先前的半监督与自监督基线,我们的简单框架在各种表格少样本学习基准上带来了显著的性能提升。代码见 https://github.com/jaehyun513/STUNT。

关键词

引用

@article{arxiv.2303.00918,
  title  = {STUNT: Few-shot Tabular Learning with Self-generated Tasks from Unlabeled Tables},
  author = {Jaehyun Nam and Jihoon Tack and Kyungmin Lee and Hankook Lee and Jinwoo Shin},
  journal= {arXiv preprint arXiv:2303.00918},
  year   = {2023}
}

备注

ICLR 2023 (Spotlight)