面向盲人和低视力读者的漫画可及性
人工智能
2024-09-11 v2
摘要
本工作探索了如何使用带有上下文信息的提示工程技术对大型语言模型进行微调,以生成对完整故事的准确文本描述,准备转发给语音合成工具。我们提议使用现有的计算机视觉和光学字符识别技术从漫画条纹图像内容中构建一个扎实的上下文,包括面板、角色、文本、阅读顺序以及气泡与角色的关联。然后我们推断角色识别并生成包含角色外观、姿态、情绪、对话等的上下文感知面板描述的漫画书剧本。我们相信,这种丰富的内容描述可以轻松用于生产具有各种角色声音、标题和声效的有声书和电子书。
引用
@article{arxiv.2407.08248,
title = {Toward accessible comics for blind and low vision readers},
author = {Christophe Rigaud and Jean-Christophe Burie and Samuel Petit},
journal= {arXiv preprint arXiv:2407.08248},
year = {2024}
}
备注
Accepted to MANPU 2024 (Athens, Greece, August 30, 2024)