中文

PosterSum:面向科学海报摘要生成的多模态基准

计算机视觉与模式识别 2025-02-26 v1 人工智能 计算与语言

摘要

从多模态文档中生成准确且简洁的文本摘要具有挑战性,尤其是在处理科学海报等视觉上复杂的内容时。我们引入了 PosterSum,这是一个新颖的基准,旨在推动视觉-语言模型的发展,使其能够理解科学海报并将其总结为研究论文摘要。我们的数据集包含 16,305 张会议海报及其作为摘要的对应摘要。每张海报以图像格式提供,并呈现出多样的视觉理解挑战,如复杂的布局、密集的文本区域、表格和图表。我们在 PosterSum 上对最先进的多模态大语言模型(MLLMs)进行了基准测试,结果表明它们难以准确解释和总结科学海报。我们提出了 Segment & Summarize,这是一种分层方法,在自动评估指标上优于当前的 MLLMs,在 ROUGE-L 上取得了 3.14% 的提升。这将为未来关于海报摘要生成的研究提供一个起点。

关键词

引用

@article{arxiv.2502.17540,
  title  = {PosterSum: A Multimodal Benchmark for Scientific Poster Summarization},
  author = {Rohit Saxena and Pasquale Minervini and Frank Keller},
  journal= {arXiv preprint arXiv:2502.17540},
  year   = {2025}
}

备注

This paper includes a dataset of research posters with abstracts. We provide two cited examples ( arXiv:2211.11880 and arXiv:2210.07571 ) to illustrate reference summaries