中文

ICT 领域中基于多模态大语言模型的图像描述生成:弥合通用领域与行业领域的差距

计算机视觉与模式识别 2026-05-08 v2

摘要

在信息与通信技术(ICT)行业,训练特定领域的大语言模型(LLM)或构建检索增强生成系统需要大量高价值的领域知识。然而,这些知识不仅隐藏在文本模态中,也隐藏在图像模态中。传统方法可以从领域文档中解析文本,但不具备图像描述生成能力。多模态大语言模型(MLLM)能够理解图像,但缺乏充足的领域知识。为解决上述问题,本文提出了一种多阶段渐进式训练策略,在 ICT 领域训练特定领域图像描述生成模型(DICModel),并构建了标准评估系统以验证 DICModel 的性能。具体而言,本工作首先结合 Mermaid 工具与 LLM 合成了约 7K 图文对,用于 DICModel 的第一阶段监督微调(SFT)。随后,ICT 领域专家人工标注了约 2K 图文对,用于 DICModel 的第二阶段 SFT。最后,专家与 LLM 联合合成了约 1.5K 视觉问答数据,用于基于指令的 SFT。实验结果表明,仅有 7B 参数的 DICModel 优于具有 32B 参数的其他 SOTA 模型。与 7B 和 32B 参数的 SOTA 模型相比,DICModel 的 BLEU 指标分别提升了约 56.8% 和 20.8%。在 ICT 领域专家构建的客观问题上,DICModel 的准确率比 Qwen2.5-VL 32B 高出 1%。总而言之,本工作能够高效、准确地从图像中提取逻辑文本,有望推动 ICT 领域多模态模型的发展。

关键词

引用

@article{arxiv.2601.09298,
  title  = {Multi-Modal LLM based Image Captioning in ICT: Bridging the Gap Between General and Industry Domain},
  author = {Lianying Chao and Kai Zhang and Haoran Cai and Sijie Wu and Xubin Li and Xin Chen},
  journal= {arXiv preprint arXiv:2601.09298},
  year   = {2026}
}