vLLM Hook v0:面向 vLLM 的编程模型内部插件
机器学习
2026-03-10 v1 计算与语言
编程语言
摘要
现代人工智能模型部署于推理引擎以优化运行时效率和资源分配,尤其针对基于 Transformer 的大语言模型 (LLM)。vLLM 项目是主要开源库,支持模型 serving 与推理。然而,当前 vLLM 实现限制了已部署模型内部状态的可编程性,阻止了流行的 test-time model alignment 与增强方法的使用。例如,无法基于注意力模式检测对抗性提示,也无法根据激活驾驶调整模型响应。为填补这一关键差距,我们提出 vLLM Hook——一个开源插件,使能 vLLM 模型内部状态的编程。基于配置文件指定需捕获的内部状态,vLLM Hook 为 vLLM 提供无缝集成,支持两种核心功能:被动编程与主动编程。被动编程中,vLLM Hook probes 选定内部状态以进行后续分析,同时保持模型生成完整;主动编程中,vLLM Hook 通过 altering 选定内部状态实现高效干预模型生成。除呈现 vLLM Hook 核心功能外,v0 版本演示了三项用例:包括 prompt injection 检测、增强检索增强检索 (RAG),以及激活驾驶。我们欢迎社区通过 https://github.com/ibm/vllm-hook 贡献以改进 vLLM Hook。
引用
@article{arxiv.2603.06588,
title = {vLLM Hook v0: A Plug-in for Programming Model Internals on vLLM},
author = {Ching-Yun Ko and Pin-Yu Chen},
journal= {arXiv preprint arXiv:2603.06588},
year = {2026}
}