评估基于 LLM 的列类型标注中的知识生成与自我精炼策略
计算与语言
2025-03-05 v1
摘要
理解关系表格列的语义是数据湖索引 preprocessing 的重要步骤,以提供丰富的数据检索。列类型标注 (CTA) 是一种建立此类理解的方法,其目标是将表格列用给定词汇表中的术语进行标注。本文实验性地比较不同知识生成与自我精炼策略在 LLM 基础列类型标注中的表现。这些策略包括使用 LLMs 生成术语定义、基于错误的术语定义精炼、自我纠正以及使用示例和术语定义进行微调。我们在有效性(以 F1 为度量)和效率(以 token 使用量和成本为度量)两个维度上评估这些策略。实验表明,最佳策略取决于模型与数据集的组合。我们发现,使用训练数据生成标签定义的效果优于使用相同数据作为 demonstrations 进行的 in-context learning,在 3 个数据集中使用 OpenAI 模型时,2 个数据集的结果如此。实验进一步表明,使用 LLMs 对标签定义进行精炼可使 10 个 12 个实验 setup 中平均提升 3.9% F1 分数。将微调模型与自我精炼术语定义组合使用可实现整体最佳性能,至少比 zero-shot prompting 微调模型高出 3% F1 分数。成本分析显示,在需要标注较少表格的场景中,基于提示的自我精炼更具成本效益,而微调在大量表格标注场景中更高效。
引用
@article{arxiv.2503.02718,
title = {Evaluating Knowledge Generation and Self-Refinement Strategies for LLM-based Column Type Annotation},
author = {Keti Korini and Christian Bizer},
journal= {arXiv preprint arXiv:2503.02718},
year = {2025}
}