中文

SEA:通过元素级常识视觉问答评估素描抽象效率

计算机视觉与模式识别 2026-03-31 v1

摘要

素描是一种视觉抽象的浓缩形式,通过简化但有目的的笔触传达核心概念,同时省略多余细节。尽管其表达力强大,但量化素描中语义抽象的效率仍然具有挑战性。依赖参考图像、低级视觉特征或识别准确率的现有评估方法无法捕捉抽象——素描的定义性属性。为解决这些局限性,我们引入了SEA(Sketch Evaluation metric for Abstraction efficiency),一种无参考度量,用于评估素描在保持语义可识别性的同时如何经济地表示类定义视觉元素。这些元素是根据关于素描中通常描绘的特征的常识知识逐类推导得出的。SEA利用视觉问答模型来确定每个元素的存在与否,并返回一个反映视觉经济性下语义保留程度的定量分数。为支持该度量,我们提出了CommonSketch——第一个语义标注素描数据集,包含跨越300个类别的23,100个人手绘素描,每个素描都配有标题和元素级标注。实验表明,SEA与人类判断高度一致,并能可靠地辨别抽象效率的不同水平,而CommonSketch作为一个基准,为各种视觉语言模型中的元素级素描理解提供了系统性评估。

关键词

引用

@article{arxiv.2603.28363,
  title  = {SEA: Evaluating Sketch Abstraction Efficiency via Element-level Commonsense Visual Question Answering},
  author = {Jiho Park and Sieun Choi and Jaeyoon Seo and Minho Sohn and Yeana Kim and Jihie Kim},
  journal= {arXiv preprint arXiv:2603.28363},
  year   = {2026}
}