Manga109Dialog:面向漫画说话人检测的大规模对话数据集
计算机视觉与模式识别
2024-04-23 v2
摘要
不断扩大的电子漫画市场激发了开发自动化漫画分析方法的热情。为进一步理解漫画,需要一种自动化方法将漫画中的文本链接到说话的角色。漫画说话人检测研究具有实际应用,例如有声书的自动角色分配、依据角色个性的自动翻译,以及角色关系与故事的推断。为应对说话人-文本标注不足的问题,我们基于Manga109创建了一个新的标注数据集Manga109Dialog。Manga109Dialog是世界上最大的漫画说话人标注数据集,包含132,692个说话人-文本对。我们进一步按预测难度将数据集划分为不同层级,以更恰当地评估说话人检测方法。不同于现有主要基于距离的方法,我们提出一种使用场景图生成模型的基于深度学习的方法。由于漫画的独特特征,我们通过考虑分帧阅读顺序提升了所提模型的性能。我们使用Manga109Dialog与其他数据集进行了实验。实验结果表明,我们的基于场景图的方法优于现有方法,预测准确率超过75%。
引用
@article{arxiv.2306.17469,
title = {Manga109Dialog: A Large-scale Dialogue Dataset for Comics Speaker Detection},
author = {Yingxuan Li and Kiyoharu Aizawa and Yusuke Matsui},
journal= {arXiv preprint arXiv:2306.17469},
year = {2024}
}
备注
Accepted to ICME2024