解锁漫画:面向视觉理解的 AI4VA 数据集
计算机视觉与模式识别
2024-10-29 v1 新兴技术
摘要
在不断发展的深度学习领域,迫切需要更全面的数据集以训练跨多种模态的模型。与此同时,在数字人文领域,利用技术进行多样化媒体改编与创作的需求日益增长,但受限于版权和风格限制,可用数据集稀少。为弥补这一空白,本文提出了一个新颖的数据集,包含 20 世纪 50 年代的法比漫画,并标注了深度估计、语义分割、显著性检测和角色识别等任务。该数据集包含两种截然不同且一致的风格,并融入了取自自然图像的目标概念与标签。通过包含跨风格的多样化信息,该数据集不仅为计算创造力带来了希望,也为艺术数字化与叙事创新提供了途径。该数据集是 AI4VA Workshop Challenges~\url{https://sites.google.com/view/ai4vaeccv2024} 的关键组成部分,我们在其中专门探讨了深度和显著性。数据集详情见 \url{https://github.com/IVRL/AI4VA}。
引用
@article{arxiv.2410.20459,
title = {Unlocking Comics: The AI4VA Dataset for Visual Understanding},
author = {Peter Grönquist and Deblina Bhattacharjee and Bahar Aydemir and Baran Ozaydin and Tong Zhang and Mathieu Salzmann and Sabine Süsstrunk},
journal= {arXiv preprint arXiv:2410.20459},
year = {2024}
}
备注
ECCV 2024 Workshop Proceedings