Satyrn:一个用于分析增强生成的平台
计算与语言
2024-10-04 v2
摘要
大型语言模型 (LLM) 能够生成文档,而检索增强生成 (RAG) 已被证明是一种在不牺牲流畅性的情况下提高准确性的强大方法。然而,并非所有信息都可以从文本中检索。我们提出了一种方法,该方法利用对结构化数据的分析来生成事实集,这些事实集用于指导生成,其方式与 RAG 中使用检索到的文档非常相似。这种分析增强生成 (AAG) 方法支持利用标准分析技术来生成事实,然后将这些事实转换为文本并传递给 LLM。我们提出了一个神经符号平台 Satyrn,它利用 AAG 来生成基于大规模数据库的准确、流畅且连贯的报告。在我们的实验中,我们发现 Satyrn 生成的报告中超过 86% 的声明是准确的,同时保持了高水平的流畅性和连贯性,即使使用较小的语言模型(如 Mistral-7B)也是如此,相比之下,GPT-4 Code Interpreter 中只有 57% 的声明是准确的。
引用
@article{arxiv.2406.12069,
title = {Satyrn: A Platform for Analytics Augmented Generation},
author = {Marko Sterbentz and Cameron Barrie and Shubham Shahi and Abhratanu Dutta and Donna Hooshmand and Harper Pack and Kristian J. Hammond},
journal= {arXiv preprint arXiv:2406.12069},
year = {2024}
}
备注
Accepted to EMNLP 2024