MCiteBench:用于生成带引用文本的多模态基准
计算与语言
2025-05-21 v3 信息检索
摘要
多模态大语言模型(MLLMs)在整合多种模态方面取得了进展,但经常会出现幻觉问题。缓解此问题的一个有前景的解决方案是生成带引用的文本,提供一种可供验证的透明链条。然而,现有工作主要侧重于为文本内容生成引用,留下了多模态场景的挑战基本未探索。本文引入了 MCiteBench,即第一个旨在评估 MLLMs 在多模态上下文中生成带引用文本能力的基准测试。我们的基准测试包含来自学术论文和审稿-争论互动的数据,涵盖多样化的信息来源和多模态内容。实验结果表明,MLLMs 在处理多模态输入时难以可靠地对输出进行 grounding。进一步的分析揭示了系统性的模态偏差,揭示了模型在生成引用时如何依赖不同来源,为理解模型行为并指导面向多模态引用任务的未来方向提供了洞见。
关键词
引用
@article{arxiv.2503.02589,
title = {MCiteBench: A Multimodal Benchmark for Generating Text with Citations},
author = {Caiyu Hu and Yikai Zhang and Tinghui Zhu and Yiwei Ye and Yanghua Xiao},
journal= {arXiv preprint arXiv:2503.02589},
year = {2025}
}
备注
https://caiyuhu.github.io/MCiteBench/