中文

面向视障人士的多模态图像描述生成

计算与语言 2021-05-19 v1

摘要

盲人群体了解周遭环境的方式之一为拍摄图像并依赖图像描述系统生成的描述。当前面向视障人士的图像描述工作,在生成描述时未利用图像中存在的文本数据。该问题十分关键,因为许多视觉场景包含文字;且盲人所拍图像相关提问中高达 21% 涉及其中的文本。本工作中,我们提出改进最先进的图像描述模型 AoANet,以将图像中检测到的文本作为入力特征。此外,我们采用指针-生成器机制,在需精确复现 token 时将检测文本拷贝至描述。我们的模型在基准数据集 VizWiz 上优于 AoANet,于 CIDEr 与 SPICE 分数分别取得 35% 与 16.2% 的性能提升。

关键词

引用

@article{arxiv.2105.08106,
  title  = {Multi-Modal Image Captioning for the Visually Impaired},
  author = {Hiba Ahsan and Nikita Bhalla and Daivat Bhatt and Kaivankumar Shah},
  journal= {arXiv preprint arXiv:2105.08106},
  year   = {2021}
}

备注

8 pages, 2 figures, 2 tables, accepted to NAACL-HLT SRW 2021