大语言模型推理时干预用于可靠需求验证
人工智能
2025-03-19 v1 软件工程
摘要
引导大语言模型 (LLM) 的行为仍是一个挑战,尤其是在对精确性和可靠性要求极高的工程应用中。虽然微调和提示方法可以修改模型行为,但缺乏对工程应用所需的动态和精确控制。推理时干预技术提供了有前景的替代方案,允许对 LLM 输出进行针对性调整。本文演示了如何通过干预实现对 Model-Based Systems Engineering (MBSE) 中通常耗时的需求验证过程进行细粒度控制。我们运用两个初级的 Capella SysML 模型(伴随关联需求),将干预后的 LLM 用于推理图表示的模型,以确定需求是否被满足。该方法在基线模型和微调方法上均显著优于,实现了稳健可靠的输出。通过识别和修改仅 1-3 个专用注意力头,即可显著改变模型行为。结合自洫性 (self-consistency),可在持有测试集上实现完美精确率。
引用
@article{arxiv.2503.14130,
title = {Inference-Time Intervention in Large Language Models for Reliable Requirement Verification},
author = {Paul Darm and James Xie and Annalisa Riccardi},
journal= {arXiv preprint arXiv:2503.14130},
year = {2025}
}