中文

StructLM:邁向構建結構化知識 grounding 的通用模型

计算与语言 2024-10-08 v7

摘要

表格、圖譜和數據庫等結構化數據源是無處不在的知識來源。儘管大型語言模型(LLM)在純文本上展現了卓越能力,但它們在解釋和利用結構化數據方面的熟練程度仍然有限。我們的調查揭示了 LLM 處理結構化數據能力的顯著不足,例如 ChatGPT 平均落後於最先進(SoTA)模型 35%。為了增強 LLM 中的結構化知識 grounding (SKG) 能力,我們開發了一個包含 110 萬個示例的全面指令微調數據集。利用該數據集,我們基於 Mistral 和 CodeLlama 模型系列訓練了一系列名為 StructLM 的模型,參數量從 7B 到 34B 不等。我們的 StructLM 系列在 18 個評估數據集中的 16 個上超越了特定任務模型,並在 8 個 SKG 任務上建立了新的 SoTA 性能。此外,StructLM 在 6 個新型保留 SKG 任務上表現出強大的泛化能力,平均超越 TableLlama 35%,平均超越 Flan-UL2 20B 10%。與預期相反,我們觀察到擴大模型規模僅帶來邊際效益,StructLM-34B 相比 StructLM-7B 僅顯示出輕微改進。這表明結構化知識 grounding 仍然是一項具有挑戰性的任務,需要更具創新的設計將其推向新水平。

关键词

引用

@article{arxiv.2402.16671,
  title  = {StructLM: Towards Building Generalist Models for Structured Knowledge Grounding},
  author = {Alex Zhuang and Ge Zhang and Tianyu Zheng and Xinrun Du and Junjie Wang and Weiming Ren and Stephen W. Huang and Jie Fu and Xiang Yue and Wenhu Chen},
  journal= {arXiv preprint arXiv:2402.16671},
  year   = {2024}
}

备注

Technical Report