中文

Violet:基于 Gemini 解码器的阿拉伯语图像描述视觉-语言模型

计算机视觉与模式识别 2024-09-30 v4 图形学

摘要

尽管图像描述有广泛应用,但在英语以外的语言中尚未充分发挥其潜力。例如,阿拉伯语虽为超过 4 亿人的母语,在该领域仍严重代表性不足。这归因于标注数据的缺乏以及强大的阿拉伯语生成模型之匮乏。我们通过提出一种专用于阿拉伯语的新型视觉-语言模型(命名为 Violet)来缓解此问题。我们的模型基于视觉编码器与 Gemini 文本解码器,在保持生成流畅性的同时实现视觉与语言组件的融合。为训练模型,我们引入一种从现有英文数据集自动获取数据的新方法。我们还手动准备了一个用于评估的新数据集。Violet 在所有评估数据集上均大幅优于基线。例如,其在我们手动标注的数据集上达到 61.2 的 CIDEr 分数,并在 Flickr8k 上取得 13 分的提升。

关键词

引用

@article{arxiv.2311.08843,
  title  = {Personalized Video Relighting With an At-Home Light Stage},
  author = {Jun Myeong Choi and Max Christman and Roni Sengupta},
  journal= {arXiv preprint arXiv:2311.08843},
  year   = {2024}
}