中文

为视障人士描述聚焦于认知和视觉细节的图像:一种生成包容性段落的方法

计算机视觉与模式识别 2022-02-17 v2 人工智能 计算与语言 机器学习

摘要

由于辅助技术和人工智能领域的成就,近期出现了多种面向视障人士的服务。尽管辅助系统的可用性有所增长,但支持特定任务的服务仍然缺乏,例如理解在线内容(如网络研讨会)中呈现的图像上下文。图像描述技术及其变体作为辅助技术存在局限性,因为它们在生成特定描述时无法满足视障人士的需求。我们提出了一种生成网络研讨会图像上下文的方法,该方法将密集描述技术与一组过滤器相结合,使描述符合我们的领域,并使用语言模型完成抽象摘要任务。结果表明,通过结合图像分析方法和神经语言模型,我们可以生成具有更高可解释性且聚焦于该群体相关信息描述。

关键词

引用

@article{arxiv.2202.05331,
  title  = {Describing image focused in cognitive and visual details for visually impaired people: An approach to generating inclusive paragraphs},
  author = {Daniel Louzada Fernandes and Marcos Henrique Fonseca Ribeiro and Fabio Ribeiro Cerqueira and Michel Melo Silva},
  journal= {arXiv preprint arXiv:2202.05331},
  year   = {2022}
}

备注

Accepted in the 17th International Joint Conference on Computer Vision, Imaging and Computer Graphics Theory and Applications (VISAPP) 2022