大语言模型指令遵循的神经符号验证
人工智能
2026-01-27 v1
摘要
将大语言模型应用于重要应用的一个基本问题是,大语言模型并不总是遵循指令,且违规行为往往难以观察或检查。在基于大语言模型的智能体工作流中,此类违规行为会沿着推理链传播和放大,导致任务失败和系统事故。本文提出了NSVIF,一个用于验证大语言模型输出是否遵循用于提示该模型的指令的神经符号框架。NSVIF是一个通用的、普适的验证器;它对指令或大语言模型不做任何假设。NSVIF通过将用户指令建模为约束,将指令遵循验证表述为一个约束满足问题。NSVIF对逻辑约束和语义约束都进行建模;约束求解由一个统一的求解器完成,该求解器协调逻辑推理和语义分析。为了评估NSVIF,我们开发了VIFBENCH,一个带有细粒度数据标签的指令遵循验证器新基准。实验表明,NSVIF显著优于基于大语言模型的方法,并提供可解释的反馈。我们还表明,来自NSVIF的反馈有助于在无需后训练的情况下提高大语言模型的指令遵循能力。
引用
@article{arxiv.2601.17789,
title = {Neuro-Symbolic Verification on Instruction Following of LLMs},
author = {Yiming Su and Kunzhao Xu and Yanjie Gao and Fan Yang and Cheng Li and Mao Yang and Tianyin Xu},
journal= {arXiv preprint arXiv:2601.17789},
year = {2026}
}