中文

面向像素级视觉实体链接的逆向区域到实体标注

计算机视觉与模式识别 2024-12-19 v1 人工智能 计算与语言 信息检索 多媒体

摘要

视觉实体链接(VEL)是实现细粒度视觉理解的关键任务,旨在将图像中的物体(视觉提及)与知识库中的实体进行匹配。以往的 VEL 任务依赖文本输入,但为复杂场景编写查询具有挑战性。点击或边界框等视觉输入提供了一种更便捷的替代方案。因此,我们提出了一项新任务——像素级视觉实体链接(PL-VEL),该任务使用来自视觉输入的像素掩码来指代物体,作为 VEL 参考方法的补充。为了促进对该任务的研究,我们通过一个全自动的逆向区域-实体标注框架构建了 MaskOVEN-Wiki 数据集。该数据集包含超过 500 万条将像素级区域与实体级标签对齐的标注,将推动视觉理解向细粒度发展。此外,由于像素掩码对应图像中的语义区域,我们通过视觉语义分词方法,利用区域交互注意力增强了先前的图块交互注意力。人工评估结果表明,该逆向标注框架达到了 94.8% 的标注成功率。实验结果显示,在该数据集上训练的模型相比零样本模型准确率提升了 18 个百分点。此外,语义分词方法相比已训练的基线模型实现了 5 个百分点的准确率提升。

关键词

引用

@article{arxiv.2412.13614,
  title  = {Reverse Region-to-Entity Annotation for Pixel-Level Visual Entity Linking},
  author = {Zhengfei Xu and Sijia Zhao and Yanchao Hao and Xiaolong Liu and Lili Li and Yuyang Yin and Bo Li and Xi Chen and Xin Xin},
  journal= {arXiv preprint arXiv:2412.13614},
  year   = {2024}
}

备注

AAAI 2025;Dataset are released at https://github.com/NP-NET-research/PL-VEL