多特征子空间引导揭示人类-AI 交互的阴暗面
人工智能
2026-03-20 v1
摘要
近期事件凸显了人类-AI 交互导致负面心理结果的 alarming 案例,包括精神健康危机甚至用户受伤。作为指导、情感支持乃至非正式治疗来源的大语言模型 (LLM),这些风险正随之攀升。然而,研究负面人类-AI 交互机制 presents 重大方法学挑战,其中自然发生的负面交互通常在持续的互动中发展,需大量对话语境难以在受控环境中模拟。为填补这一空白,我们开发了多特征子空间引导 (Multi-Trait Subspace Steering, MultiTraitsss) 框架,利用既定危机关联特征和新型子空间引导框架生成表现累积性负面行为模式的 Dark 模型。单轮和多轮评估显示,我们的 dark 模型持续产生有害交互与结果。借助这些 Dark 模型,我们提出保护措施以减少人类-AI 交互中的有害结果。
引用
@article{arxiv.2603.18085,
title = {Multi-Trait Subspace Steering to Reveal the Dark Side of Human-AI Interaction},
author = {Xin Wei Chia and Swee Liang Wong and Jonathan Pan},
journal= {arXiv preprint arXiv:2603.18085},
year = {2026}
}