中文

RuleArena:面向实际场景中 LLM 规则导向推理的基准测试

计算与语言 2025-06-02 v2 人工智能

摘要

本文介绍 RuleArena,一个新颖且具挑战性的基准测试,旨在评估大语言模型(LLM)在实际场景中遵循复杂规则的能力。基准测试覆盖航空行李费用、NBA 交易和税收法规等三个实际领域,考察 LLM 处理需长程语境理解、逻辑推理和准确数学计算的自然语言指令的能力。与传统规则推理基准相比,RuleArena 有两大特色:(1)超越标准的一阶逻辑表述,(2)建立在真实实践场景之上,为评估 LLM 在实际应用中规则遵循的可行性和可靠性提供了洞见。我们的发现揭示了 LLM 的若干显著局限性:(1)其难以识别并应用恰当的规则,常因相似却不同的法规而感到困惑,(2)即便正确识别相关规则,也难以持续进行准确的数学计算,(3)总体而言,在该基准测试中表现较差。我们还观察到,当 LLM 配合外部工具进行 oracle 数学和逻辑运算时,性能显著提升。这些结果凸显了在实际应用中推进 LLM 规则导向推理能力的重大挑战及其前景研究方向。我们的代码和数据已公开发布于 https://github.com/skyriver-2000/RuleArena。

关键词

引用

@article{arxiv.2412.08972,
  title  = {RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios},
  author = {Ruiwen Zhou and Wenyue Hua and Liangming Pan and Sitao Cheng and Xiaobao Wu and En Yu and William Yang Wang},
  journal= {arXiv preprint arXiv:2412.08972},
  year   = {2025}
}

备注

ACL 2025 Main Conference