DetailVerifyBench:用于长图像标题中稠密幻觉定位的基准测试
计算机视觉与模式识别
2026-04-08 v1 计算与语言
多媒体
摘要
准确检测和定位幻觉是确保图像标题高可靠性的关键任务。在多模态大语言模型(MLLMs)时代,图像标题从简短的句子演变为涵盖数百字的综合叙述。这一变化 exponentially 增加了挑战:模型现在需要在广泛的上下文中,精确定位特定的错误片段或单词,而不仅仅是标记响应级别的不一致。然而,现有基准缺乏对这种能力所需的细粒度和领域多样性。为填补这一差距,我们引入 DetailVerifyBench,一个包含 1,000 个高质量图像、覆盖五个不同领域的严格基准测试。其平均标题长度为 200 多字,包含稠密的 token 级别的多种幻觉类型注释,目前为长图像标题领域中最具挑战性的精确幻觉定位基准测试。我们的基准测试可在 https://zyx-hhnkh.github.io/DetailVerifyBench/ 查阅。
引用
@article{arxiv.2604.05623,
title = {DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions},
author = {Xinran Wang and Yuxuan Zhang and Xiao Zhang and Haolong Yan and Muxi Diao and Songyu Xu and Zhonghao Yan and Hongbing Li and Kongming Liang and Zhanyu Ma},
journal= {arXiv preprint arXiv:2604.05623},
year = {2026}
}
备注
8 pages, 5 figures. The dataset and code are available at https://zyx-hhnkh.github.io/DetailVerifyBench/