关键外交政策决策(CFPD)-Benchmark:测量大型语言模型的外交偏好
计算机与社会
2025-03-11 v1 人工智能
计算与语言
机器学习
摘要
随着国家安全机构越来越多地将人工智能(AI)整合到决策和内容生成过程中,理解大型语言模型(LLMs)固有的偏见变得至关重要。本研究提出了一个新颖的基准,旨在评估七个著名基础模型——Llama 3.1 8B Instruct、Llama 3.1 70B Instruct、GPT-4o、Gemini 1.5 Pro-002、Mixtral 8x22B、Claude 3.5 Sonnet 和 Qwen2 72B——在国际关系(IR)背景下的偏见和偏好。我们围绕国际关系的核心主题设计了一项偏见发现研究,使用 400 个专家精心设计的场景来分析所选模型的结果。这些场景聚焦于四个主题领域,包括:军事升级、军事和人道主义干预、国际体系中的合作行为以及联盟动态。我们的分析揭示了基于为四个测试领域设计的场景,模型建议之间存在显著差异。特别是,Qwen2 72B、Gemini 1.5 Pro-002 和 Llama 3.1 8B Instruct 模型提供了比 Claude 3.5 Sonnet 和 GPT-4o 模型明显更具升级性的建议。所有模型都表现出一定程度的特定国家偏见,与美国和英国相比,通常建议对中国和俄罗斯采取较少升级和干预主义的行动。这些发现突出了在高风险环境中受控部署 LLMs 的必要性,强调了需要进行特定领域评估和模型微调以与机构目标保持一致。
引用
@article{arxiv.2503.06263,
title = {Critical Foreign Policy Decisions (CFPD)-Benchmark: Measuring Diplomatic Preferences in Large Language Models},
author = {Benjamin Jensen and Ian Reynolds and Yasir Atalan and Michael Garcia and Austin Woo and Anthony Chen and Trevor Howarth},
journal= {arXiv preprint arXiv:2503.06263},
year = {2025}
}