中文

政治科学中的大语言模型: heralding 视觉分析新时代

计算机视觉与模式识别 2024-03-28 v2 人工智能

摘要

政治学家对利用图像中可用的大量信息的兴趣日益增加。然而,解释这些图像的挑战在于需要计算机视觉方面的专业知识和专用硬件的访问权限。因此,图像分析仅限于政治科学界内相对较小的一群人。得益于大语言模型(LLMs)的兴起,这一局面可能会发生改变。本文旨在提高人们对使用 Gemini 进行图像内容分析可行性的认识。我们对包含 688 张图像的语料库进行了回顾性分析。针对每张图像从 Gemini elicited 内容报告,然后由作者进行手动评估。我们发现 Gemini 在执行物体检测方面具有极高的准确性,这可以说是政治学家图像分析中最常见和最基本的任务。同样重要的是,我们表明它易于实施,因为整个命令仅由一个自然语言提示组成;运行速度快,应能满足大多数研究者的时间预算;并且免费使用,不需要任何专用硬件。此外,我们说明了政治学家如何利用 Gemini 进行其他图像理解任务,包括人脸识别、情感分析和标题生成。我们的研究结果表明,Gemini 和其他类似的 LLMs 有可能极大地刺激和加速政治科学及更广泛的社会科学中的图像研究。

关键词

引用

@article{arxiv.2403.00154,
  title  = {LLMs in Political Science: Heralding a New Era of Visual Analysis},
  author = {Yu Wang},
  journal= {arXiv preprint arXiv:2403.00154},
  year   = {2024}
}

备注

7 pages, 3 tables