ChatbotManip:用于促进对操纵性聊天机器人行为评估与监督的数据集
计算与语言
2026-05-12 v2
摘要
本文介绍了 ChatbotManip,这是一个用于研究聊天机器人操纵行为的数据集。它包含模拟的、在聊天机器人与(模拟)用户之间进行的对话,其中聊天机器人被明确要求展示操纵策略、说服用户达成某种目标,或仅仅是提供帮助。我们考虑了来自消费者建议、个人建议、市民建议和有争议的论点论证等多样化的聊天机器人操纵情境。每段对话都由人类标注员对一般操纵和特定操纵策略进行标注。我们的研究发现,三个关键发现:首先,大型语言模型(LLM)在被明确指示时会表现出操纵行为,标注员在约 84% 的此类对话中识别出操纵;其次,即使仅要求“说服”而不明确要求操纵,LLM 也经常默认采用争议性操纵策略,尤其是谎言和恐惧放大;第三,小型微调开源模型(如 BERT+BiLSTM)在检测操纵方面的表现与大型模型(如 Gemini 2.5 pro)的零样本分类相当,但尚不够可靠,可用于实际监督。我们的工作为 AI 安全研究提供了重要见解,凸显了随着 LLM 在面向消费者的应用中不断部署,需解决操纵风险的必要性。
引用
@article{arxiv.2506.12090,
title = {ChatbotManip: A Dataset to Facilitate Evaluation and Oversight of Manipulative Chatbot Behaviour},
author = {Jack Contro and Simrat Deol and Yulan He and Martim Brandão},
journal= {arXiv preprint arXiv:2506.12090},
year = {2026}
}