CRAB:评估真实世界事件间因果关系的强度
计算与语言
2023-11-09 v1 人工智能
摘要
理解叙事需要对文本中提及的事件之间的因果关系的推理。尽管现有基础模型在许多需要推理的 NLP 任务中取得了令人印象深刻的结果,但尚不清楚它们是否理解叙事中事件底层因果关系的复杂网络。在这项工作中,我们提出 CRAB,一个新的因果推理评估基准(Causal Reasoning Assessment Benchmark),旨在评估对真实世界叙事中事件的因果理解。CRAB 包含约 2.7K 对真实世界事件的细粒度、上下文因果标注,这些事件描述了各种有新闻价值的事件时间线(例如 Elon Musk 收购 Twitter)。使用 CRAB,我们衡量了若干大语言模型的性能,表明大多数系统在该任务上表现不佳。受经典因果原理启发,我们还分析了 CRAB 中事件组的因果结构,发现当事件源自复杂因果结构而非简单线性因果链时,模型的因果推理表现更差。我们向研究界公开了数据集与代码。
引用
@article{arxiv.2311.04284,
title = {CRAB: Assessing the Strength of Causal Relationships Between Real-world Events},
author = {Angelika Romanou and Syrielle Montariol and Debjit Paul and Leo Laugier and Karl Aberer and Antoine Bosselut},
journal= {arXiv preprint arXiv:2311.04284},
year = {2023}
}