人人可读的漫画:为漫画条生成无障碍文本描述
计算机视觉与模式识别
2023-10-03 v1 人机交互
摘要
漫画条是一种流行且富有表现力的视觉叙事形式,可传达幽默、情感与信息。然而,对于BLV(盲人或低视力)群体而言,他们无法感知漫画的图像、版式与文字,因而漫画对其是无障碍障碍的。本文的目标是创建对视障群体可及的漫画条自然语言描述。我们的方法包含两步:首先,利用计算机视觉技术提取漫画图像中有关分格、角色与文字的信息;其次,将此类信息作为额外上下文,提示多模态大语言模型(MLLM)生成描述。我们在一组由人类专家标注的漫画上测试了方法,并使用定量与定性指标衡量其性能。实验结果令人鼓舞且充满前景。
引用
@article{arxiv.2310.00698,
title = {Comics for Everyone: Generating Accessible Text Descriptions for Comic Strips},
author = {Reshma Ramaprasad},
journal= {arXiv preprint arXiv:2310.00698},
year = {2023}
}
备注
Accepted at CLVL: 5th Workshop On Closing The Loop Between Vision And Language (ICCV 2023 Workshop)