中文

可信视觉-语言模型的探索:综述

计算机视觉与模式识别 2023-12-08 v1 人工智能

摘要

近年来,Transformer在计算机视觉和视觉-语言任务中变得非常流行。这种显著增长的用途主要归功于注意力机制提供的能力以及Transformer适应并应用于各种任务和领域的出色能力。它们的多功能性和最先进的性能使它们成为广泛应用中不可或缺的工具。然而,在机器学习不断变化的格局中,确保Transformer的可信度至关重要。本文对视觉-语言Transformer进行了深入考察,采用了负责任AI的三个基本原则:偏见、鲁棒性和可解释性。本文的主要目标是深入探讨与Transformer实际使用相关的复杂性和难题,总体目标是增进我们对如何提高其可靠性和责任性的理解。

关键词

引用

@article{arxiv.2312.04231,
  title  = {Adventures of Trustworthy Vision-Language Models: A Survey},
  author = {Mayank Vatsa and Anubhooti Jain and Richa Singh},
  journal= {arXiv preprint arXiv:2312.04231},
  year   = {2023}
}

备注

Accepted in AAAI 2024