大语言模型作为调解者:它们能准确诊断冲突吗?
计算与语言
2025-11-24 v1
摘要
先前的研究表明,要能够调解双方之间不一致的观察者必须可靠地区分不一致来源是源于对事实正确性的信念差异(因果性)还是源于价值观差异(道德性)。在本文中,我们测试OpenAI的大型语言模型GPT 3.5和GPT 4是否能够完成这一任务,以及某一种或另一种类型的不一致对LLM的诊断是否尤其具有挑战性。我们复制了Ko\c{c}ak等人(2003)的研究 1,该研究采用情景设计,包含OpenAI的GPT 3.5和GPT 4。我们发现,两种LLM在语义层面上与人类相似,能够可靠地区分因果代码和道德代码之间的区别。就诊断对话中不一致来源时,两种LLM相对于人类,表现出对因果不一致的高估和对道德不一致的低估,这种情况尤其在GPT 4使用依赖具体语言的具体尺度时更为突出。GPT 3.5在使用任何具体或遥远尺度时都不如GPT 4或人类表现。该研究提供了首次测试LLM用于调解通过诊断因果与评估代码中不一致根源潜力的可能性。
引用
@article{arxiv.2412.14675,
title = {LLMs as mediators: Can they diagnose conflicts accurately?},
author = {Özgecan Koçak and Phanish Puranam and Afşar Yegin},
journal= {arXiv preprint arXiv:2412.14675},
year = {2025}
}
备注
27 pages, 2 appendices, 21 tables (incl appendices)