中文

MIMDE:探讨合成数据与人类数据在多洞察多文档提取任务中的应用

计算与语言 2024-12-02 v1

摘要

大语言模型 (LLM) 在文本分析任务中展现出惊人的能力,但其在复杂真实应用场景的评估仍富有挑战性。我们定义了一类任务,即多洞察多文档提取 (Multi-Insight Multi-Document Extraction, MIMDE) 任务,其涉及从文档语料库中提取一组最优洞察,并将这些洞察映射回其来源文档。该任务是许多实际应用的基础,从分析调查响应到处理医疗记录,均关乎识别和追踪跨文档的关键洞察。我们构建了 MIMDE 的评估框架,引入了一套新的互补的人类数据与合成数据,用于检验合成数据在 LLM 评估中的潜力。经过建立用于比较提取洞察的优化指标后,我们在两个数据集上对 20 种最先进的 LLM 进行基准测试。我们的分析显示,LLM 在两个数据集上提取洞察的能力呈现强相关性 (0.71),但合成数据未能捕捉文档层面分析的复杂性。这些发现为合成数据在评估文本分析系统方面的应用提供了关键指导,凸显了其潜力与局限性。

关键词

引用

@article{arxiv.2411.19689,
  title  = {MIMDE: Exploring the Use of Synthetic vs Human Data for Evaluating Multi-Insight Multi-Document Extraction Tasks},
  author = {John Francis and Saba Esnaashari and Anton Poletaev and Sukankana Chakraborty and Youmna Hashem and Jonathan Bright},
  journal= {arXiv preprint arXiv:2411.19689},
  year   = {2024}
}