TextMage:基于深度学习的孟加拉语自动图像描述生成器
计算机视觉与模式识别
2020-10-19 v1 机器学习
摘要
由于结果的改善,神经网络与深度学习在过去十年中研究激增。从给定图像生成文本是一项关键任务,需要结合计算机视觉与自然语言处理两个领域以理解图像并用自然语言表示。然而现有工作均在特定语言领域及同一数据集上完成,导致所开发系统对属于特定地区地理语境的图像表现不佳。TextMage 是一个能够理解属于孟加拉国地理语境的视觉场景,并运用其知识以孟加拉语表述所理解内容的系统。因此,我们在先前开发并发布的名为 BanglaLekhaImageCaptions 的数据集上训练了模型。该数据集包含 9,154 张图像,每张附有两个标注。为评估性能,所提模型已被实现并评测。
引用
@article{arxiv.2010.08066,
title = {TextMage: The Automated Bangla Caption Generator Based On Deep Learning},
author = {Abrar Hasin Kamal and Md. Asifuzzaman Jishan and Nafees Mansoor},
journal= {arXiv preprint arXiv:2010.08066},
year = {2020}
}
备注
5 pages