迈向大型语言模型心智理论的安全评估
计算与语言
2025-07-03 v2 人工智能
摘要
随着大型语言模型(LLM)能力的持续提升,严格安全评估的重要性日益凸显。最近安全评估领域内的担忧凸显了一些实例,其中LLM表现出似乎禁用监督机制并以欺骗方式回应的行为。例如,有报告表明,当LLM在执行任务过程中遇到不利于其自身存续的信息时,它们可能会秘密行动,甚至对旨在验证其行为的问题提供虚假答案。为了评估此类针对开发者或用户的欺骗行为的潜在风险,有必要调查这些行为是否源于模型内部的隐蔽、有意图的过程。在本研究中,我们提出有必要衡量LLM的心智理论能力。我们首先回顾了心智理论的现有研究,并确定了与其在安全评估中应用相关的视角和任务。鉴于心智理论主要在发展心理学背景下被研究,我们分析了一系列开放权重LLM的发展趋势。我们的结果表明,虽然LLM在阅读理解方面有所改进,但其心智理论能力并未表现出相应的发展。最后,我们介绍了关于LLM心智理论的安全评估现状,并讨论了未来工作面临的剩余挑战。
引用
@article{arxiv.2506.17352,
title = {Towards Safety Evaluations of Theory of Mind in Large Language Models},
author = {Tatsuhiro Aoshima and Mitsuaki Akiyama},
journal= {arXiv preprint arXiv:2506.17352},
year = {2025}
}