中文

动员威利:评估面向公众动员的多模态 AI

人机交互 2024-12-20 v1 计算机与社会 社会与信息网络

摘要

多模态大型语言模型(LLMs)的进步,如 OpenAI 的 GPT-4o,为在各种情境下介导人类交互提供了巨大潜力。然而,它们在说服、影响和招募等领域的使用引发了伦理和安全方面的担忧。为了在公共影响和说服场景中合乎伦理地评估这些模型,我们开发了一种提示策略,使用“寻找威利?”图像作为复杂、拥挤集会的代理。这种方法提供了一个可控、可复制的环境,以评估模型处理复杂视觉信息、解释社会动态并提出参与策略的能力,同时避免了隐私问题。通过将威利定位为负责面对面动员的假设代理,我们分析了模型在识别关键个体和制定动员策略方面的表现。我们的结果表明,尽管模型能够生成生动的描述和创造性的策略,但它无法在这些场景中准确识别个体或可靠地评估社会动态。尽管如此,该方法学为测试和基准化多模态 LLMs 在社会情境中不断演变的能力提供了一个有价值的框架。

关键词

引用

@article{arxiv.2412.14210,
  title  = {Mobilizing Waldo: Evaluating Multimodal AI for Public Mobilization},
  author = {Manuel Cebrian and Petter Holme and Niccolo Pescetelli},
  journal= {arXiv preprint arXiv:2412.14210},
  year   = {2024}
}

备注

11 pages, 2 figures, 2 tables