中文

迈向鲁棒的超详细图像描述:多智能体方法与面向事实性和覆盖率的对偶评估指标

计算机视觉与模式识别 2025-07-08 v4

摘要

多模态大语言模型(MLLM)擅长生成高度详细的描述,但经常产生幻觉。我们的分析表明,现有的幻觉检测方法在处理详细描述时存在困难。我们将此归因于随着序列长度的增加,MLLM越来越依赖其生成的文本,而不是输入图像。为了解决这一问题,我们提出了一种多智能体方法,利用LLM与MLLM的协作来纠正给定的描述。此外,我们引入了一个评估框架和一个基准数据集,以促进对详细描述的系统性分析。我们的实验表明,与现有指标相比,我们提出的评估方法更符合人类对事实性的判断,并且现有的提升MLLM事实性的方法在超详细图像描述任务中可能表现不佳。相比之下,我们提出的方法显著提高了描述的事实准确性,甚至改进了由GPT-4V生成的描述。最后,我们强调了以VQA为中心的基准测试的局限性,证明MLLM在VQA基准测试上的表现可能与其生成详细图像描述的能力不相关。我们的代码和数据可在https://github.com/adobe-research/CapMAS获取。

关键词

引用

@article{arxiv.2412.15484,
  title  = {Toward Robust Hyper-Detailed Image Captioning: A Multiagent Approach and Dual Evaluation Metrics for Factuality and Coverage},
  author = {Saehyung Lee and Seunghyun Yoon and Trung Bui and Jing Shi and Sungroh Yoon},
  journal= {arXiv preprint arXiv:2412.15484},
  year   = {2025}
}

备注

ICML 2025