带上下文的替代文本:改进Twitter上图像的可访问性
计算机视觉与模式识别
2024-03-04 v3 计算与语言
机器学习
摘要
本文提出了一种为社交媒体( specifically Twitter)上分享的图像生成替代文本(alt-text)描述的方法。替代文本不仅仅是图像字幕的特殊情形,它更具字面描述性且针对特定上下文。同样关键的是,发布到Twitter上的图像常附有用户撰写的文本,这些文本虽未必描述图像,却可能提供有用上下文,若妥善利用则具参考价值。我们以多模态模型应对该任务,同时以关联社交媒体帖子的文本信息与图像的视觉信号为条件,并证明这两种信息源的效用具有叠加性。我们提出了一个包含371k图像及其替代文本与推文的新数据集(抓取自Twitter),并基于多种自动指标及人工评估对其进行评测。结果表明,我们同时以推文文本与视觉信息为条件的方法显著优于先前工作,在BLEU@4上超出两倍以上。
引用
@article{arxiv.2305.14779,
title = {Alt-Text with Context: Improving Accessibility for Images on Twitter},
author = {Nikita Srivatsan and Sofia Samaniego and Omar Florez and Taylor Berg-Kirkpatrick},
journal= {arXiv preprint arXiv:2305.14779},
year = {2024}
}
备注
ICLR 2024