中文

ArcheType:面向开源列类型标注的新型大语言模型框架

计算与语言 2024-08-20 v3 机器学习

摘要

现有深度学习方法进行语义列类型标注 (CTA) 存在诸多局限:它们依赖于训练时固定的语义类型;需要每个类型大量训练样本且推理成本高;甚至在类型保持不变的情况下,对新数据集的评估性能也会下降。大语言模型在广泛的任务中展现出强大的零样本分类能力,本文探索其在 CTA 问题中的应用。我们引入 ArcheType,一种简单实用的上下文抽样、提示序列化、模型查询与标签重映射方法,使大语言模型能够以完全零样本方式解决 CTA 挑战。我们单独消融方法的各个组件,确证改进上下文抽样和标签重映射提供了最一致的提升。ArcheType 在零样本 CTA 基准测试中实现了新的最佳性能(包括我们随论文发布的三个新领域特定基准),并与经典 CTA 技术结合时,在经微调的 SOTAB 基准上超越了 SOTA DoDuo 模型。我们的代码已公开于 https://github.com/penfever/ArcheType。

关键词

引用

@article{arxiv.2310.18208,
  title  = {ArcheType: A Novel Framework for Open-Source Column Type Annotation using Large Language Models},
  author = {Benjamin Feuer and Yurong Liu and Chinmay Hegde and Juliana Freire},
  journal= {arXiv preprint arXiv:2310.18208},
  year   = {2024}
}

备注

VLDB 2024