语义相似度是漫画理解的虚假度量:来自基准实验中幻觉的经验教训
机器学习
2026-03-03 v1 计算与语言
计算机视觉与模式识别
摘要
为盲人或视力受损者提供漫画/ manga 访问的系统将为这一群体引入新的叙事媒介。然而,目前尚无此类系统存在。生成式视觉语言模型(VLM)在描述图像和理解漫画方面显示出前景,但大多数漫画理解研究仅限于面板层面。为了完全支持盲人和视力受损者,必须更加关注页面层面的理解和解释。本文提出了一个VLM在漫画解释任务上的初步基准测试。我们识别并归类了在此过程中出现的幻觉,将其组织为通用的对象幻觉分类。我们以指导未来研究为结论,强调幻觉缓解和改进漫画解释的数据 curated。
引用
@article{arxiv.2603.01950,
title = {Semantic Similarity is a Spurious Measure of Comic Understanding: Lessons Learned from Hallucinations in a Benchmarking Experiment},
author = {Christopher Driggers-Ellis and Nachiketh Tibrewal and Rohit Bogulla and Harsh Khanna and Sangpil Youm and Christan Grant and Bonnie Dorr},
journal= {arXiv preprint arXiv:2603.01950},
year = {2026}
}
备注
8 pages, 2 figures, 3 tables. Includes link to code