中文

多模态结构化生成:CVPR第二届MMFM挑战赛技术报告

计算机视觉与模式识别 2025-02-06 v2 计算与语言

摘要

多模态基础模型在计算机视觉和自然语言处理任务中都展现出了强大的性能。然而,在需要这两种模态高度集成的任务(如文档理解)中,它们的性能会下降。此外,与单模态模型相比,微调和部署这些模型需要显著更多的计算资源和工程工作。在这项工作中,我们提出了多模态结构化生成,这是一个通过将硬约束直接应用于输出logits来强制(冻结的)多模态基础模型以严格结构化格式生成输出的框架。这种方法不仅确保模型生成下游API易于解析的输出,还允许我们强制模型在回答之前进行推理,从而显著提升性能,而无需昂贵的微调。我们通过在CVPR第二届MMFM挑战赛中的竞争性结果证明了我们方法的有效性,强调了精心设计的轻量级工程可以胜过昂贵且复杂的建模方法。我们所有的脚本、部署步骤和评估结果都可以在https://github.com/leloykun/MMFM-Challenge获取。

关键词

引用

@article{arxiv.2406.11403,
  title  = {Multimodal Structured Generation: CVPR's 2nd MMFM Challenge Technical Report},
  author = {Franz Louis Cesista},
  journal= {arXiv preprint arXiv:2406.11403},
  year   = {2025}
}

备注

Conference on Computer Vision and Pattern Recognition's 2nd Multimodal Foundation Models Challenge