TABLET:从指令中学习表格数据
机器学习
2023-04-27 v1 计算与语言
摘要
在训练用于表格预测的机器学习(ML)模型时,获取高质量数据通常是一项重大挑战,尤其在医学和金融等隐私敏感且成本高昂的领域。向大语言模型(LLMs)提供自然语言指令提供了一种替代方案。然而,指令在多大程度上有效利用了LLMs中的知识来解决表格预测问题尚不清楚。为弥补这一空白,我们引入TABLET,一个包含20个多样化表格数据集的基准,这些数据集标注了在措辞、粒度和专业性上各异的指令。此外,TABLET还包括指令的逻辑以及对指令的结构化修改。我们发现上下文指令使Flan-T5 11b在TABLET上的零样本F1性能平均提升44%,ChatGPT提升13%。同时,我们通过评估指令忠实度探讨了在我们的基准中使用LLMs进行表格预测的局限性。我们发现LLMs经常忽略指令,即使有示例也无法正确预测特定实例。我们对TABLET的分析表明,虽然指令有助于LLM性能,但从指令中学习表格数据需要新的能力。
引用
@article{arxiv.2304.13188,
title = {TABLET: Learning From Instructions For Tabular Data},
author = {Dylan Slack and Sameer Singh},
journal= {arXiv preprint arXiv:2304.13188},
year = {2023}
}
备注
Please find the TABLET demo and code at https://dylanslacks.website/Tablet