CaT-BENCH:基准测试语言模型对计划中因果与时间依赖性的理解
计算与语言
2025-01-09 v3
摘要
理解 LLM 处理自然语言计划(如指令文本和食谱)的能力对于可靠地将其应用于决策系统至关重要。计划的一个基本方面是其步骤的执行顺序,这反映了它们之间 underlying 的因果依赖关系。我们引入 CaT-Bench,这是一个步骤顺序预测问题基准测试,用于测试步骤是否必然在另一个步骤之前或之后发生。我们使用它来评估前沿 LLM 理解因果和时间依赖性的能力。我们发现 SOTA LLM 表现平平(最佳零-shot F1 分数仅为 0.59),并且倾向于频繁预测依赖关系,可能是依赖于步骤的时间顺序作为启发式。对解释进行提示和使用 few-shot 示例会显著提升性能,但最佳 F1 分数仍仅为 0.73。进一步地,对解释以及答案正确性的人类评估显示,平均而言,人类并不认为模型的推理是正确的。意外地,我们还发现,在回答后解释比正常的链式思维提示更好,以及 LLM 对同一步骤对问题的答案在一致性方面表现不佳。总体而言,结果表明 LLM 检测步骤之间依赖关系的能力仍有显著提升的余地。
引用
@article{arxiv.2406.15823,
title = {CaT-BENCH: Benchmarking Language Model Understanding of Causal and Temporal Dependencies in Plans},
author = {Yash Kumar Lal and Vanya Cohen and Nathanael Chambers and Niranjan Balasubramanian and Raymond Mooney},
journal= {arXiv preprint arXiv:2406.15823},
year = {2025}
}
备注
Accepted to EMNLP 2024 Main Conference