基于 CLIP 的“猜猜是谁?”游戏实现
计算机视觉与模式识别
2021-12-02 v1 机器学习
摘要
CLIP(Contrastive Language-Image Pretraining,对比语言-图像预训练)是一种从自然语言监督中学习计算机视觉任务的高效方法,因其零样本迁移能力推动了深度学习领域近期的突破。通过在互联网上可用的图像-文本对上进行训练,CLIP 模型无需任何特定数据集的训练即可非零样本地迁移到大多数任务。在本工作中,我们使用 CLIP 实现流行游戏“猜猜是谁?”的引擎,使玩家使用自然语言提示与游戏交互,并由 CLIP 自动判断游戏棋盘中的图像是否满足该提示。我们通过以不同提示提问方式对 CLIP 进行基准测试来研究该方法的表现,并展示了其零样本能力的局限性。
引用
@article{arxiv.2112.00599,
title = {An implementation of the "Guess who?" game using CLIP},
author = {Arnau Martí Sarri and Victor Rodriguez-Fernandez},
journal= {arXiv preprint arXiv:2112.00599},
year = {2021}
}
备注
Code available at https://github.com/ArnauDIMAI/CLIP-GuessWho