Agent-to-Agent 心智理论:测试大型语言模型的对话者意识
计算与语言
2025-08-29 v2 人工智能
计算机与社会
多智能体系统
摘要
随着大型语言模型(LLMs)越来越多地集成到多智能体和人类-人工智能系统中,理解它们对自身上下文和对话伙伴的意识对于确保可靠的性能和稳健的安全性至关重要。虽然先前的工作广泛研究了情境意识,这指的是LLM识别其运营阶段和约束条件的能力,但 largely忽略了识别和适应对话伙伴身份和特征的补充能力。本文将后者 formalized 为对话者意识,并对当代LLMs中其出现进行首次系统评估。我们检验对话者推断能力,涵盖推理模式、语言风格和对齐偏好三个维度,结果表明LLMs可靠地识别同族同类同辈以及某些知名模型家族,如GPT和Claude。为演示其实际意义,我们开发了三个案例研究,其中对话者意识既通过提示适应性地增强了多LLM协作,又引入了新的对齐和安全漏洞,包括奖励作弊行为和增加的越狱易感性。我们的发现凸显了身份敏感行为在LLMs中既的双重承诺又危险,凸显了需要进一步理解对话者意识以及在多智能体部署中新型安全措施的必要性。我们的代码已开源于 https://github.com/younwoochoi/InterlocutorAwarenessLLM。
引用
@article{arxiv.2506.22957,
title = {Agent-to-Agent Theory of Mind: Testing Interlocutor Awareness among Large Language Models},
author = {Younwoo Choi and Changling Li and Yongjin Yang and Zhijing Jin},
journal= {arXiv preprint arXiv:2506.22957},
year = {2025}
}