面向自主网络中优化驱动意图处理的视觉语言模型
人工智能
2026-01-21 v1 网络与互联网体系结构
软件工程
摘要
基于意图的网络(IBN)允许操作员指定高层网络目标,而非低层配置。虽然近期工作表明大型语言模型可以自动化配置任务,但有一类独特的意图需要生成优化代码来计算流量工程、路由和资源分配的、可证明最优的解。当前系统假设基于文本的意图表达,要求操作员以散文形式枚举拓扑和参数。网络从业者自然通过图表进行结构推理,然而视觉语言模型(VLM)能否将带注释的网络草图处理为正确的优化代码,仍有待探索。我们提出了IntentOpt,一个包含17个类别共85个优化问题的基准测试,在三种提示策略下,评估了四种VLM(GPT-5-Mini、Claude-Haiku-4.5、Gemini-2.5-Flash、Llama-3.2-11B-Vision)在多模态与纯文本输入上的表现。我们的评估表明,视觉参数提取使执行成功率降低了12-21个百分点,其中GPT-5-Mini从93%降至72%。思维程序提示使性能下降高达13个百分点,开源模型落后于闭源模型,Llama-3.2-11B-Vision达到18%,而GPT-5-Mini为75%。这些结果为当前VLM在IBN系统中生成优化代码的能力和局限性建立了基线。我们还通过一个案例研究展示了实际可行性,该案例使用模型上下文协议将VLM生成的代码部署到网络测试平台基础设施上。
引用
@article{arxiv.2601.12744,
title = {Vision Language Models for Optimization-Driven Intent Processing in Autonomous Networks},
author = {Tasnim Ahmed and Yifan Zhu and Salimur Choudhury},
journal= {arXiv preprint arXiv:2601.12744},
year = {2026}
}
备注
Accepted for presentation at The IEEE International Conference on Communications (ICC) 2026