中文

Rosetta-PL:命题逻辑作为大型语言模型推理基准

计算与语言 2025-05-06 v2

摘要

大型语言模型(LLM)主要是在高资源天然语言上训练的,这限制了其在低资源环境和需要深层逻辑推理的任务中的有效性。本研究引入Rosetta-PL,一个旨在评估LLM在受控环境中进行逻辑推理和泛化能力的基准测试。我们通过将Lean中的一组逻辑命题翻译成自定义逻辑语言来构建Rosetta-PL,然后用于微调LLM(例如GPT-4o)。我们的实验分析了数据集大小和翻译方法对模型性能的影响。我们的结果表明,保持翻译过程中逻辑关系的完整性可显著提升精度,当训练样本数超过约20,000后,准确率会趋于平台化。这些发现为优化LLM在形式推理任务中的训练并提升在各种低资源语言应用中的性能提供了有价值的指导。

关键词

引用

@article{arxiv.2505.00001,
  title  = {Rosetta-PL: Propositional Logic as a Benchmark for Large Language Model Reasoning},
  author = {Shaun Baek and Shaun Esua-Mensah and Cyrus Tsui and Sejan Vigneswaralingam and Abdullah Alali and Michael Lu and Vasu Sharma and Sean O'Brien and Kevin Zhu},
  journal= {arXiv preprint arXiv:2505.00001},
  year   = {2025}
}