中文

通过表征工程进行多主体情境下的合作人格识别

人工智能 2025-03-18 v1 计算与语言 计算机科学与博弈论 多智能体系统

摘要

随着大型语言模型(LLM)具备自主能力,其在多主体情境中的协调作用日益重要。然而,它们往往在合作方面存在困难,导致结果次优。以冯·阿克塞尔的迭代囚徒困境(IPD)比赛为灵感,我们探讨人格特质如何影响 LLM 的合作。通过表征工程,我们在 LLM 中引导大五人格(如同情心、勤勉性)并分析其对 IPD 决策的影响。我们的结果表明,较高的同情心和勤勉性可提高合作水平,但会增加被剥削的风险,这凸显了基于人格的引导在 AI 智能体对齐方面的潜力与局限性。

关键词

引用

@article{arxiv.2503.12722,
  title  = {Identifying Cooperative Personalities in Multi-agent Contexts through Personality Steering with Representation Engineering},
  author = {Kenneth J. K. Ong and Lye Jia Jun and Hieu Minh "Jord" Nguyen and Seong Hah Cho and Natalia Pérez-Campanero Antolín},
  journal= {arXiv preprint arXiv:2503.12722},
  year   = {2025}
}

备注

Poster, Technical AI Safety Conference 2025