中文

带上下文的替代文本:改进Twitter上图像的可访问性

计算机视觉与模式识别 2024-03-04 v3 计算与语言 机器学习

摘要

本文提出了一种为社交媒体( specifically Twitter)上分享的图像生成替代文本(alt-text)描述的方法。替代文本不仅仅是图像字幕的特殊情形,它更具字面描述性且针对特定上下文。同样关键的是,发布到Twitter上的图像常附有用户撰写的文本,这些文本虽未必描述图像,却可能提供有用上下文,若妥善利用则具参考价值。我们以多模态模型应对该任务,同时以关联社交媒体帖子的文本信息与图像的视觉信号为条件,并证明这两种信息源的效用具有叠加性。我们提出了一个包含371k图像及其替代文本与推文的新数据集(抓取自Twitter),并基于多种自动指标及人工评估对其进行评测。结果表明,我们同时以推文文本与视觉信息为条件的方法显著优于先前工作,在BLEU@4上超出两倍以上。

关键词

引用

@article{arxiv.2305.14779,
  title  = {Alt-Text with Context: Improving Accessibility for Images on Twitter},
  author = {Nikita Srivatsan and Sofia Samaniego and Omar Florez and Taylor Berg-Kirkpatrick},
  journal= {arXiv preprint arXiv:2305.14779},
  year   = {2024}
}

备注

ICLR 2024