KamonBench:用于评估视觉语言模型中组成因素恢复的语法基准数据集
计算机视觉与模式识别
2026-05-19 v2 机器学习
摘要
Kamon(家纹)是日本文化的重要组成部分,也是组合视觉识别的自然测试案例:每个纹章组合少量符号选择,但可能的描述空间较稀疏。我们介绍 KamonBench,一个基于语法的图像到结构基准数据集,包含 20,000 个合成复合纹章及辅助组件示例。每个合成纹章配有正式的 kamon 描述语言——“kamon y\=ogo”——描述、分段日文分析、英文翻译以及非语言程序代码。由于每个合成纹章均由已知因素(即容器、修饰符和图案)生成,KamonBench 支持超越描述级别准确率的评估:直接程序代码因素指标、受控因素对重新组合划分、在固定容器-修饰符上下文下的反事实图案灵敏度组,以及因素可访问性的线性探针。我们提供了 ViT 编码器/Transformer 解码器和两个 VGG n-gram 解码器的基线结果,带和不带学习位置掩码。因此,KamonBench 为稀疏的组合视觉识别和因素恢复提供了受控测试环境。
引用
@article{arxiv.2605.13322,
title = {KamonBench: A Grammar-Based Dataset for Evaluating Compositional Factor Recovery in Vision-Language Models},
author = {Richard Sproat and Stefano Peluchetti},
journal= {arXiv preprint arXiv:2605.13322},
year = {2026}
}
备注
Preprint