中文

列标题词汇关联(CVA):基于元数据的表格语义解释

计算与语言 2024-09-24 v1 人工智能

摘要

传统的语义表格解释(STI)方法主要依赖底层表格数据来创建语义注释。今年的SemTab挑战赛引入了“Metadata to KG”赛道,侧重于仅使用元数据信息进行STI,而无需访问底层数据。针对这一新挑战,我们提出一种新术语:列标题词汇关联(CVA)。该术语指仅基于元数据信息对列标题进行语义标注的任务。本研究评估了 various 方法在执行CVA任务中的性能,包括大语言模型(LLM)和检索增强生成(RAG)方法,以及更传统的基于SemanticBERT的相似性方法。我们的 methodology 采用零样本 setting,即不进行预训练或传递给大语言模型的示例,以避免特定领域的 setting。我们调查了共7种不同的 LLM,其中3种商业 GPT 模型(gpt-3.5-turbo-0.125、gpt-4o和gpt-4-turbo)和4种开源模型(llama3-80b、llama3-7b、gemma-7b和mixtral-8x7b)。我们将这些模型与 RAG 系统集成,探讨了不同温度设置对性能的影响。此外,我们继续通过使用 SemanticBERT 执行 CVA 任务,分析了 various 元数据信息如何影响其性能。初始发现表明,LLM 在温度低于1.0 时通常表现良好,在某些情况下实现100% 的准确率。然而,我们的调查也发现,数据性质显著影响 CVA 任务的结果。实际上,在输入数据和词汇表相关的情况下(例如由同一组织创建),传统方法似乎超过了 LLM 的性能。

关键词

引用

@article{arxiv.2409.13709,
  title  = {Column Vocabulary Association (CVA): semantic interpretation of dataless tables},
  author = {Margherita Martorana and Xueli Pan and Benno Kruit and Tobias Kuhn and Jacco van Ossenbruggen},
  journal= {arXiv preprint arXiv:2409.13709},
  year   = {2024}
}