多模态大语言模型(MLLM):从理论到实践
计算与语言
2026-02-16 v1 计算机视觉与模式识别
摘要
多模态大语言模型(MLLM)将大语言模型的自然语言理解与生成能力与图像和音频等模态的感知能力相结合,代表了当代人工智能的关键进展。本章介绍了MLLM的主要基础知识和标志性模型。还探讨了使用LangChain和LangGraph进行预处理、提示工程和构建多模态流水线的实用技术。为进一步的实践学习,补充材料可在线公开获取:https://github.com/neemiasbsilva/MLLMs-Teoria-e-Pratica。最后,本章讨论了挑战并强调了有前景的趋势。
引用
@article{arxiv.2602.12302,
title = {Grandes Modelos de Linguagem Multimodais (MLLMs): Da Teoria \`a Pr\'atica},
author = {Neemias da Silva and Júlio C. W. Scholz and John Harrison and Marina Borges and Paulo Ávila and Frances A Santos and Myriam Delgado and Rodrigo Minetto and Thiago H Silva},
journal= {arXiv preprint arXiv:2602.12302},
year = {2026}
}
备注
in Portuguese language. Accepted book chapter - Webmedia 2025