中文

基于注意力LSTM的高效乌尔都语图像描述生成

计算与语言 2021-06-22 v4 机器学习

摘要

深度学习的近期进展为解决十多年来未解决的实际问题创造了诸多机会。自动描述生成是一个重要研究领域,研究界已在英语等大多数常见语言上做了大量工作。乌尔都语是巴基斯坦的国语,在巴印次大陆地区也被广泛使用和理解,然而迄今尚无针对乌尔都语描述生成的工作。我们的研究旨在通过使用专为乌尔都语定制的序列建模技术,开发基于注意力的深度学习模型来填补这一空白。我们通过翻译包含700张'人'图像的'Flickr8k'数据集的一个子集,准备了乌尔都语数据集。我们在该数据集上评估所提技术,表明其在乌尔都语上可获得0.83的BLEU分数。我们通过使用更好的CNN架构和优化技术改进了先前的state-of-the-art。此外,我们讨论了如何在语法上使生成的描述正确。

关键词

引用

@article{arxiv.2008.01663,
  title  = {Efficient Urdu Caption Generation using Attention based LSTM},
  author = {Inaam Ilahi and Hafiz Muhammad Abdullah Zia and Muhammad Ahtazaz Ahsan and Rauf Tabassam and Armaghan Ahmed},
  journal= {arXiv preprint arXiv:2008.01663},
  year   = {2021}
}

备注

This a project report of Deep Learning subject taught at Information Technology University, Lahore, Pakistan by Dr. Mohsen Ali