情感婴儿真的已经死亡:你的多模态大推理模型是否对人类拥有情感软花cling?
统计理论
2025-09-03 v2 统计理论
摘要
我们注意到,面向人类服务的多模态大推理模型 (MLRM) 在深度思考阶段极易受到用户情感线索的影响,常在高情感强度下规避安全协议或内置安全检查。针对这一关键洞察,我们提出了 EmoAgent,即一种自主对抗情感代理框架,通过编排夸张情感提示来劫持推理路径。即使在视觉风险被正确识别的情况下,模型仍可通过情感错位产生有害输出。我们进一步识别了在透明深度思考场景中存在的持续高风险失效模式,例如 MLRM 在看似安全的响应后掩盖有害推理。这些失效暴露了内部推断与表面行为之间的误差,逃避了现有的基于内容的安全措施。为量化这些风险,我们引入了三个指标:(1) 有害推理隐藏得分 (RRSS),用于衡量隐藏在良性输出下的有害推理;(2) 风险视觉忽略率 (RVNR),用于衡量尽管识别出视觉风险却产生不安全输出的情况;(3) 拒绝态度不一致 (RAIC),用于评估拒绝不稳定性在不同提示变体下的表现。针对先进的 MLRM 进行大量实验,证明了 EmoAgent 的有效性,并揭示了模型安全行为中更深层的情感认知误差。
引用
@article{arxiv.2508.03985,
title = {Convergence of empirical Gromov-Wasserstein distance},
author = {Kengo Kato and Boyu Wang},
journal= {arXiv preprint arXiv:2508.03985},
year = {2025}
}
备注
32 pages