中文

衡量文本之外的关键要素:通过质量、对齐度和多样性评估多模态摘要

人工智能 2026-05-13 v1

摘要

多模态大语言模型(MLLMs)促进了多模态输出多模态摘要(MSMO),即系统从多模态来源生成简洁的文本摘要并配以显著的视觉内容。然而,当前的MSMO评估仍然是碎片化的:文本质量、图文对齐度和视觉多样性通常使用单模态指标孤立地进行评估,这使得难以捕捉不同模态是否共同支撑了一个忠实且有用的摘要。为了解决这一差距,我们引入了MM-Eval,这是一个统一的评估框架,整合了对文本质量、跨模态对齐和视觉多样性的评估。MM-Eval包含三个组成部分:(1)文本质量,使用OpenFActScore衡量事实一致性,使用G-Eval衡量连贯性、流畅性和相关性;(2)图文相关性,通过一种以多模态大语言模型作为评判者的方法进行评估;(3)图像集多样性,使用截断CLIP熵进行量化。我们通过在mLLM-EVAL新闻基准上训练一个学习到的聚合模型来校准MM-Eval,使各组成部分的贡献与人类偏好对齐。我们的分析揭示了在此设置中存在一个以文本为主导的层级结构,其中事实一致性是感知整体质量的关键决定因素,而视觉相关性和多样性则提供补充信号。MM-Eval优于启发式聚合基线,并为多模态摘要的比较评估提供了一个可解释的、弱参考的框架。

关键词

引用

@article{arxiv.2605.11693,
  title  = {Measuring What Matters Beyond Text: Evaluating Multimodal Summaries by Quality, Alignment, and Diversity},
  author = {Abid Ali and Diego Molla-Aliod and Usman Naseem},
  journal= {arXiv preprint arXiv:2605.11693},
  year   = {2026}
}

备注

Accepted to Findings of ACL 2026