中文

利用多任务学习范式对阿拉伯语自动图像字幕进行基准测试与改进

计算机视觉与模式识别 2022-03-14 v2

摘要

社交媒体及互联网上视觉内容的持续增加,加速了计算机视觉领域尤其是图像字幕任务的研究。生成最能描述图像的文本的过程是一项有用的任务,可用于图像索引、作为视障人士的听觉辅助等多种应用。近年来,图像字幕任务在数据集与架构两方面均取得显著进展,字幕质量由此达到惊人表现。然而,这些进展大多针对英语,尤其是数据集方面,致使阿拉伯语等其他语言落后。尽管阿拉伯语由逾 4.5 亿人使用且为互联网上增长最快的语言,却缺乏推进其图像字幕研究所需的基础支柱,如基准或统一数据集。本工作试图通过提供统一数据集与基准,并探索可提升阿拉伯语图像字幕性能的方法与技术,来加速该任务的协同进展。我们探索了多任务学习的使用,同时考察了多种词表示与不同特征。结果表明,多任务学习与预训练词嵌入的使用显著提升了图像字幕质量,但所给结果亦显示阿拉伯语字幕相较英语仍显落后。所用数据集与代码可通过此链接获取。

关键词

引用

@article{arxiv.2202.05474,
  title  = {Bench-Marking And Improving Arabic Automatic Image Captioning Through The Use Of Multi-Task Learning Paradigm},
  author = {Muhy Eddin Za'ter and Bashar Talafha},
  journal= {arXiv preprint arXiv:2202.05474},
  year   = {2022}
}