利用LLM改进自然语言到一阶逻辑翻译的策略:数据生成、增量微调与验证
计算与语言
2024-09-26 v1
摘要
逻辑推理是自然语言处理中的一项基础任务,对大型语言模型(LLM)提出了重大挑战。逻辑推理的固有特性使其非常适合一阶逻辑(FOL)等符号表示。符号逻辑推理的研究探索了使用最先进的LLM(即GPT-4)生成FOL,以产生自然语言(NL)语句的FOL翻译,但翻译中的错误通常不是关注重点。我们通过将LLM生成的FOL语句中的翻译错误进行分类来解决这一问题。为了在提升较小语言模型(如LLaMA-2 13B和Mistral 7B)的FOL翻译质量方面取得进展,我们使用GPT-4o创建了ProofFOL,即ProofWriter数据集的一个高质量FOL标注子集。在此银标准数据上微调的模型与LLaMA-2 70B等大型语言模型相比,取得了显著的性能提升。除了使用大数据改进模型外,我们还解决了数据稀缺问题,并引入了一个包含数据增强和验证步骤的增量框架。在增强过程中,一对(前提,结论)被基于谓词和FOL拆分为多个新实例。此数据用于微调,并且在该模型上的推理比在原始数据上训练的模型生成错误更少的FOL。我们对翻译错误的调查促成了一个扰动数据集的生成,该数据集用于训练一个验证器,以纠正潜在的FOL翻译中的语法和语义错误。我们展示了一种有效的方法,以最大限度地利用有限的现有人类标注数据集。我们的结果显示,在LLaMA-2和Mistral模型上使用ProofFOL,在ProofWriter和ProntoQA数据集上取得了最先进的性能。
引用
@article{arxiv.2409.16461,
title = {Strategies for Improving NL-to-FOL Translation with LLMs: Data Generation, Incremental Fine-Tuning, and Verification},
author = {Ramya Keerthy Thatikonda and Jiuzhou Han and Wray Buntine and Ehsan Shareghi},
journal= {arXiv preprint arXiv:2409.16461},
year = {2024}
}