中文

面向多媒体文档事件抽取的LVLMs基准测试与改进

计算与语言 2025-09-17 v1 多媒体

摘要

多媒体内容的不断涌现 necessitates开发有效的多媒体事件抽取 (M2E2)系统。虽然大型视觉语言模型 (LVLMs) 在跨模态能力方面表现突出,但其在M2E2任务中的实用性尚未得到充分探索。本文首次系统评估了代表性LVLMs,包括DeepSeek-VL2和Qwen-VL系列,在M2E2数据集上进行评估。我们的评估覆盖文本-only、图像-only以及跨媒体子任务,在few-shot提示和fine-tuning设置下进行。我们的关键发现突显了以下有价值的见解:(1) Few-shot LVLMs在视觉任务上表现显著,但在文本任务中表现严重不足;(2)通过LoRA进行fine-tuning可显著提升模型性能;(3) LVLMs在组合模态时表现出强大的协同作用,在跨模态设置下取得优异性能。我们进一步提供详细的错误分析,揭示了在语义精确性、局部化以及跨模态对齐等方面存在的持久挑战,这些挑战仍是推动M2E2能力进步的关键障碍。

关键词

引用

@article{arxiv.2509.12876,
  title  = {Benchmarking and Improving LVLMs on Event Extraction from Multimedia Documents},
  author = {Fuyu Xing and Zimu Wang and Wei Wang and Haiyang Zhang},
  journal= {arXiv preprint arXiv:2509.12876},
  year   = {2025}
}

备注

Accepted at INLG 2025. Camera-ready version