大型语言模型能否成为政策细化合作伙伴?——来自中国社会保险研究的实证分析
计算机与社会
2025-04-22 v3
摘要
大型语言模型(LLM)的快速发展正在重塑跨学科领域的操作范式。LLM在跨学科边界综合政策相关洞见的新兴能力,暗示其作为决策支持工具的潜力。然而,其实际性能和作为政策细化合作伙伴的适用性,仍需通过严谨且系统的评估进行验证。本研究运用嵌入式生成-适应框架,对美国GPT-4o、中国DeepSeek-R1和人类研究者进行三方比较,探讨LLM在为中国社会保险问题生成政策建议方面的能力边界和性能特征。本研究表明,尽管LLM在系统性政策设计中展现出distinct优势,但在解决复杂的社会动态问题、平衡利益相关者诉求、控制财政风险等方面仍面临显著局限。此外,DeepSeek-R1在政策建议生成的所有评估维度上均优于GPT-4o,说明区域化训练有助于提高情境对齐。这些发现表明,区域化适配的LLM可作为生成以领域特定社会洞见为导向的多样化政策备选方案的补充工具。然而,政策细化的制定仍需与人类研究者的专业知识相结合,这在解释制度框架、文化规范和价值体系方面仍至关重要。
引用
@article{arxiv.2504.09137,
title = {Can Large Language Models Become Policy Refinement Partners? Evidence from China's Social Security Studies},
author = {Jinghan Ke and Zheng Zhou and Yuxuan Zhao},
journal= {arXiv preprint arXiv:2504.09137},
year = {2025}
}
备注
18 pages, 4 tables, 1 figure