中文

利用不对称性生成合成训练数据:SynthIE 与信息抽取案例

计算与语言 2023-10-31 v2 人工智能 机器学习

摘要

大语言模型(LLMs)在合成数据生成方面具有巨大潜力。本工作表明,即便对于无法由 LLMs 直接解决的任务,也可合成出有用数据:对于具有结构化输出的问题,可提示 LLM 以反向执行任务,即为目标输出结构生成合理的输入文本。利用任务难度上的这种不对称性,可针对复杂任务产出大规模高质量数据。我们在封闭信息抽取上证明了该方法的有效性,该任务收集真值数据颇具挑战且迄今无满意数据集。我们合成生成了包含 180 万数据点的数据集,在人工评估中确立其相较现有数据集的更优质量,并用它微调小型模型(2.2 亿与 7.7 亿参数),称为 SynthIE,其以微平均 F1 绝对 57 分、宏平均 F1 绝对 79 分的显著优势超越同等模型规模的先前最优水平。代码、数据与模型见于 https://github.com/epfl-dlab/SynthIE。

关键词

引用

@article{arxiv.2303.04132,
  title  = {Exploiting Asymmetry for Synthetic Training Data Generation: SynthIE and the Case of Information Extraction},
  author = {Martin Josifoski and Marija Sakota and Maxime Peyrard and Robert West},
  journal= {arXiv preprint arXiv:2303.04132},
  year   = {2023}
}

备注

Accepted at EMNLP 2023