中文

评估冲突对话中的行为对齐:LLM 代理与人类的多维度比较

计算与语言 2025-09-23 v1 人工智能 人机交互

摘要

大型语言模型(LLM)日益用于社会复杂、交互驱动的任务,但其在情感和战略性复杂情境中镜像人类行为的能力仍未得到充分探索。本研究评估了基于人格提示的 LLM 在对抗性争议解决中的行为对齐情况,通过模拟包含谈判的多轮冲突对话来实现。每个 LLM 都根据匹配的五因素人格轮廓被引导,以控制个体差异并增强真实性。我们在三个维度上进行评估:语言风格、情感表达(例如愤怒动态)和战略行为。GPT-4.1 在语言风格和情感动态方面与人类的对齐程度最接近,而 Claude-3.7-Sonnet 则在战略行为方面表现最佳。尽管如此,仍存在显著的对齐差距。我们的发现为 LLM 与人类在社交复杂交互中的对齐建立了基准,凸显了人格条件化在对话建模中的希望之处与局限性。

关键词

引用

@article{arxiv.2509.16394,
  title  = {Evaluating Behavioral Alignment in Conflict Dialogue: A Multi-Dimensional Comparison of LLM Agents and Humans},
  author = {Deuksin Kwon and Kaleen Shrestha and Bin Han and Elena Hayoung Lee and Gale Lucas},
  journal= {arXiv preprint arXiv:2509.16394},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 (Main Conference)