SELF-PERCEPT:内省提升大语言模型检测对话中多人心理操控的能力
计算与语言
2025-05-28 v1 人机交互
机器学习
摘要
心理操控是人际沟通中一种微妙而普遍的虐待形式,其检测对于保护潜在受害者至关重要。然而,由于操控的细微且情境特定的特性,在复杂的多轮、多人对话中识别操控性语言 remains a significant challenge for large language models (LLMs)。为此,我们引入MultiManip数据集,包含220个多轮、多人对话,平衡了操控性和非操控性互动,全部来自模仿真实场景的情节节目。对于操控性互动,包括11种不同操控方式,描绘真实情境。我们对当前最先进的大语言模型(如GPT-4o和Llama-3.1-8B)进行广泛评估,采用多种提示策略。尽管具备这些能力,模型常常难以有效检测操控。为克服这一限制,我们提出SELF-PERCEPT,一种受自我感知理论启发的新型双阶段提示框架,在检测多人、多轮心理操控方面表现出色。我们的代码和数据已公开于 https://github.com/danushkhanna/self-percept。
引用
@article{arxiv.2505.20679,
title = {SELF-PERCEPT: Introspection Improves Large Language Models' Detection of Multi-Person Mental Manipulation in Conversations},
author = {Danush Khanna and Pratinav Seth and Sidhaarth Sredharan Murali and Aditya Kumar Guru and Siddharth Shukla and Tanuj Tyagi and Sandeep Chaurasia and Kripabandhu Ghosh},
journal= {arXiv preprint arXiv:2505.20679},
year = {2025}
}
备注
Accepted to ACL 2025 (Main)