通过小样本学习与微调对齐 MAGMA 模型
计算机视觉与模式识别
2022-10-26 v1 人工智能
摘要
视觉-语言建模的目标是让模型将语言理解与视觉输入联系起来。本文旨在评估视觉语言模型(VLM)——即通过基于适配器的微调实现生成模型多模态增强(MAGMA)——并将其与人类价值观对齐。MAGMA 是一个能够进行图像描述和视觉问答的 VLM。我们将在三种不同场景下评估其对齐情况。首先,我们通过 Hugging Face 提供的检查点评估 MAGMA 的开箱即用对齐能力。然后,我们衡量小样本学习是否能改善结果。最后,我们在对齐示例上微调模型并评估其行为。
引用
@article{arxiv.2210.14161,
title = {Aligning MAGMA by Few-Shot Learning and Finetuning},
author = {Jean-Charles Layoun and Alexis Roger and Irina Rish},
journal= {arXiv preprint arXiv:2210.14161},
year = {2022}
}
备注
Accepted by the Montreal AI Symposium conference in 2022