AmalREC: A Dataset for Relation Extraction and Classification Leveraging Amalgamation of Large Language Models
信息检索
2024-12-31 v1
摘要
现有的关系分类和抽取数据集常常存在限制,如受限的关系类型和领域特定的偏见。本 work 提出了一个通用框架,用于生成给定关系元组的结构化句子,借助大型语言模型 (LLM)。本 study 聚焦于以下主要问题:(i)如何生成关系元组的句子,(ii)如何比较和排序它们,(iii)我们能否结合 individual 方法的优势并混合它们以生成更高质量的句子,以及 (iv)如何评估最终数据集?对于第一个问题,我们采用多阶段 5 步管道方法,利用 LLM 和模板引导的生成。我们引入句子评估指数 (SEI),优先考虑像语法正确性、流畅性、人类对齐情感、准确性和复杂度等因素,以回答第二个问题的第一个部分。为了回答第二个问题的第二个部分,本 work 引入 SEI-Ranker 模块,利用 SEI 选择顶级候选生成。随后,策略性地混合顶级句子,以产生最终的高质量句子。最后,我们在 LLM-based 和 SOTA baseline 上对我们的数据集进行关系分类评估。该提出数据集 features 255 种关系类型,测试集包含约 15K 句子,训练集约 150k 句子,显著增强了关系的多样性和复杂度。这项 work 不仅提出了一个新的全面基准数据集用于 RE/RC 任务,还比较了不同 LLM 用于从关系元组生成质量句子的方法。
引用
@article{arxiv.2412.20427,
title = {AmalREC: A Dataset for Relation Extraction and Classification Leveraging Amalgamation of Large Language Models},
author = {Mansi and Pranshu Pandya and Mahek Bhavesh Vora and Soumya Bharadwaj and Ashish Anand},
journal= {arXiv preprint arXiv:2412.20427},
year = {2024}
}
备注
18 pages, 5 Figures