利用多任务学习范式对阿拉伯语自动图像字幕进行基准测试与改进
计算机视觉与模式识别
2022-03-14 v2
摘要
社交媒体及互联网上视觉内容的持续增加,加速了计算机视觉领域尤其是图像字幕任务的研究。生成最能描述图像的文本的过程是一项有用的任务,可用于图像索引、作为视障人士的听觉辅助等多种应用。近年来,图像字幕任务在数据集与架构两方面均取得显著进展,字幕质量由此达到惊人表现。然而,这些进展大多针对英语,尤其是数据集方面,致使阿拉伯语等其他语言落后。尽管阿拉伯语由逾 4.5 亿人使用且为互联网上增长最快的语言,却缺乏推进其图像字幕研究所需的基础支柱,如基准或统一数据集。本工作试图通过提供统一数据集与基准,并探索可提升阿拉伯语图像字幕性能的方法与技术,来加速该任务的协同进展。我们探索了多任务学习的使用,同时考察了多种词表示与不同特征。结果表明,多任务学习与预训练词嵌入的使用显著提升了图像字幕质量,但所给结果亦显示阿拉伯语字幕相较英语仍显落后。所用数据集与代码可通过此链接获取。
引用
@article{arxiv.2202.05474,
title = {Bench-Marking And Improving Arabic Automatic Image Captioning Through The Use Of Multi-Task Learning Paradigm},
author = {Muhy Eddin Za'ter and Bashar Talafha},
journal= {arXiv preprint arXiv:2202.05474},
year = {2022}
}