测试统一序列到序列 LLM 预训练在多样化表格数据任务上的极限
计算与语言
2023-10-03 v1 机器学习
摘要
存储在数据库中的表格以及网页和文章中的表格占据了互联网上半结构化数据的很大一部分。因此,开发一种可利用大语言模型(LLM)解决语义解析、问答以及分类问题等多样化表格任务的建模方法变得十分必要。传统上,针对每个任务分别存在专门的模型。这引发了一个问题:我们在多大程度上可以构建一个在部分表格任务上表现良好且不会在其他任务上显著退化的统一模型。为此,我们尝试在预训练阶段采用编码器-解码器风格 LLM 的共享建模方法,以适配多样化任务。我们评估了以表格及周围上下文数据持续预训练并微调不同 T5 模型族、在不同模型规模下于这些下游任务上的方法。通过多项消融研究,我们观察到采用自监督目标的预训练可显著提升模型在这些任务上的性能。作为一个改进示例,我们观察到专为文本问答(QA)定制且已在表格数据上训练过的指令微调公开模型,在表格特定 QA 方面仍有提升空间。我们的工作是首个在模型规模从 770M 扩展到 11B 序列到序列模型时研究表格特定预训练统一方法优势、同时比较模型指令微调变体的尝试。
引用
@article{arxiv.2310.00789,
title = {Testing the Limits of Unified Sequence to Sequence LLM Pretraining on Diverse Table Data Tasks},
author = {Soumajyoti Sarkar and Leonard Lausen},
journal= {arXiv preprint arXiv:2310.00789},
year = {2023}
}