中文

用于漫画重构的密集多任务学习

计算机视觉与模式识别 2023-07-18 v1 人机交互

摘要

本文中,我们开发了一个多任务学习(MTL)模型,以实现漫画面板的密集预测,进而通过辅助作者完成重构其叙事的任务,促进漫画从一种出版渠道向另一种的迁移。我们的MTL方法能成功识别漫画面板中的语义单元以及嵌入的3D概念。这是一个极具挑战性的问题,因为漫画包含依赖于作者创作过程的迥异艺术风格、插图、版式和物体尺度。通常,基于图像的密集预测技术需要大量数据语料。因此,在缺乏漫画图像真实密集标注的情况下,为漫画领域寻找密集预测的自动化方案变得更加困难。为应对这些挑战,我们开发了如下方案:1)我们利用一种称为无监督图像到图像翻译的常用策略,使我们能利用大量真实世界标注语料;2)我们利用翻译结果开发基于视觉Transformer骨干和域可迁移注意力模块的多任务方法;3)我们研究了将MTL密集预测方法与现有重定目标方法集成以重构漫画的可行性。

关键词

引用

@article{arxiv.2307.08071,
  title  = {Dense Multitask Learning to Reconfigure Comics},
  author = {Deblina Bhattacharjee and Sabine Süsstrunk and Mathieu Salzmann},
  journal= {arXiv preprint arXiv:2307.08071},
  year   = {2023}
}

备注

CVPR 2023 Workshop. arXiv admin note: text overlap with arXiv:2205.08303