中文

TABLET:从指令中学习表格数据

机器学习 2023-04-27 v1 计算与语言

摘要

在训练用于表格预测的机器学习(ML)模型时,获取高质量数据通常是一项重大挑战,尤其在医学和金融等隐私敏感且成本高昂的领域。向大语言模型(LLMs)提供自然语言指令提供了一种替代方案。然而,指令在多大程度上有效利用了LLMs中的知识来解决表格预测问题尚不清楚。为弥补这一空白,我们引入TABLET,一个包含20个多样化表格数据集的基准,这些数据集标注了在措辞、粒度和专业性上各异的指令。此外,TABLET还包括指令的逻辑以及对指令的结构化修改。我们发现上下文指令使Flan-T5 11b在TABLET上的零样本F1性能平均提升44%,ChatGPT提升13%。同时,我们通过评估指令忠实度探讨了在我们的基准中使用LLMs进行表格预测的局限性。我们发现LLMs经常忽略指令,即使有示例也无法正确预测特定实例。我们对TABLET的分析表明,虽然指令有助于LLM性能,但从指令中学习表格数据需要新的能力。

关键词

引用

@article{arxiv.2304.13188,
  title  = {TABLET: Learning From Instructions For Tabular Data},
  author = {Dylan Slack and Sameer Singh},
  journal= {arXiv preprint arXiv:2304.13188},
  year   = {2023}
}

备注

Please find the TABLET demo and code at https://dylanslacks.website/Tablet