中文

社会科学遇见大语言模型:大语言模型在社会模拟中的可靠性如何?

计算与语言 2024-11-01 v1

摘要

大语言模型(LLMs)越来越多地被用于模拟,从而在角色扮演智能体和计算社会科学(CSS)中得以应用。然而,这些模拟的可靠性尚未得到充分探索,这引发了人们对LLMs在这些应用中可信度的担忧。在本文中,我们旨在回答“基于LLM的模拟有多可靠?”为了解决这个问题,我们引入了TrustSim,这是一个涵盖10个CSS相关主题的评估数据集,用以系统地研究LLM模拟的可靠性。我们对14个LLM进行了实验,发现基于LLM的模拟角色中持续存在不一致性。此外,LLM的一致性水平与其通用性能并不强相关。为了提高LLM在模拟中的可靠性,我们提出了基于自适应学习率的ORPO(AdaORPO),这是一种基于强化学习的算法,用于提高7个LLM在模拟中的可靠性。我们的研究为未来探索更稳健、更可信的基于LLM的模拟提供了基础。

关键词

引用

@article{arxiv.2410.23426,
  title  = {Social Science Meets LLMs: How Reliable Are Large Language Models in Social Simulations?},
  author = {Yue Huang and Zhengqing Yuan and Yujun Zhou and Kehan Guo and Xiangqi Wang and Haomin Zhuang and Weixiang Sun and Lichao Sun and Jindong Wang and Yanfang Ye and Xiangliang Zhang},
  journal= {arXiv preprint arXiv:2410.23426},
  year   = {2024}
}