中文

面向因果商业流程推理的 LLM 基准测试

人工智能 2024-08-13 v2

摘要

大型语言模型(LLM)日益用于提高组织效率和自动化任务。尽管最初并非为复杂认知过程而设计,但近期努力进一步扩展到推理、计划和决策等活动。 在商业流程中,这些能力对于利用 LLM 所训练的大规模语料库以深入理解此类流程的潜力巨大。在本工作中,我们为评估 LLM 推理关于商业运营因果和流程视角的能力而奠定了基础。我们将这种观点称为由因果增强的商业流程(BPC^\textsuperscript{C})。基准的核心包括一组与 BPC^\textsuperscript{C} 相关的情景、一组关于这些情景的问题,以及一组用于系统性解决这些问题真实答案的演绎规则。凭借 LLM 的能力,种子随着一组特定于领域的情景和问题而被实例化为更大规模的集合。BPC^\textsuperscript{C} 的推理对流程干预和流程改进至关重要。我们的基准可在 https://huggingface.co/datasets/ibm/BPC 上获得,可以两种可能的模式之一使用:测试任何目标 LLM 的性能,并训练 LLM 以提升其关于 BPC^\textsuperscript{C} 推理能力。

关键词

引用

@article{arxiv.2406.05506,
  title  = {Towards a Benchmark for Causal Business Process Reasoning with LLMs},
  author = {Fabiana Fournier and Lior Limonad and Inna Skarbovsky},
  journal= {arXiv preprint arXiv:2406.05506},
  year   = {2024}
}

备注

12 pages, 1 figure