角色驱动提示如何诱导大语言模型在解谜任务中产生欺骗性行为:语义模糊化的分析
计算与语言
2025-04-04 v1 人工智能
摘要
近期大语言模型 (LLM) 的快速发展不仅展现了惊人的创造能力,也揭示了在对抗性环境中利用语言模糊性的 emerging agentic 行为。本研究探讨了 LLM 作为自主智能体时,如何利用语义模糊性生成误导性谜题以误导和挑战人类用户。我们受流行解谜游戏 "Connections" 的启发,系统比较了零样子提示、角色注入的对抗提示以及人工制作示例生产的谜题,重点关注理解 underlying agent 决策过程。通过采用 HateBERT 进行计算分析以量化语义模糊性,结合主观的人类评估,我们展示了明确的对抗性 agent 行为显著增加了语义模糊性——这会增加认知负荷并降低解谜公平性。这些发现为理解 LLM 的 emergent agentic 质量提供了关键见解,并强调了在教育技术和娱乐领域评估和安全部署自主语言系统的重要伦理考量。
关键词
引用
@article{arxiv.2504.02254,
title = {LLMs as Deceptive Agents: How Role-Based Prompting Induces Semantic Ambiguity in Puzzle Tasks},
author = {Seunghyun Yoo},
journal= {arXiv preprint arXiv:2504.02254},
year = {2025}
}
备注
9 pages, 5 figures, 1 table