中文

The Manga Whisperer:自动生成漫画的转录文本

计算机视觉与模式识别 2024-08-02 v3

摘要

在过去的几十年里,日本漫画,通常被称为 Manga,已经超越了文化和语言的界限,成为真正的全球热潮。然而,漫画对视觉线索和插图的内在依赖使得视觉障碍人士在很大程度上无法接触它。在这项工作中,我们寻求解决这一重大障碍,旨在确保每个人都能欣赏并积极参与到漫画中。具体来说,我们以完全自动化的方式解决说话人日志分离问题,即生成关于谁说了什么以及何时说的转录文本。为此,我们做出了以下贡献:(1)我们提出了一个统一模型 Magi,它能够 (a) 检测面板、文本框和角色框,(b) 按身份聚类角色(无需先验知道聚类数量),以及 (c) 将对话与其说话人相关联;(2)我们提出了一种新方法,能够按阅读顺序对检测到的文本框进行排序并生成对话转录文本;(3)我们使用公开可用的 [英文] 漫画页面为该任务标注了一个评估基准。代码、评估数据集和预训练模型可在以下网址找到:https://github.com/ragavsachdeva/magi。

关键词

引用

@article{arxiv.2401.10224,
  title  = {The Manga Whisperer: Automatically Generating Transcriptions for Comics},
  author = {Ragav Sachdeva and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2401.10224},
  year   = {2024}
}

备注

Accepted at CVPR'24