检测与引导 LLM 的行动中的同理心
计算与语言
2025-11-24 v1 人工智能
摘要
我们研究同理心行动——即愿意为解决人类需求而牺牲任务效率——作为 LLM 激活空间中的一个线性方向。使用以同理心行动(Empathy-in-Action, EIA)基准为依据的对比提示,我们在 Phi-3-mini-4k(3.8B)、Qwen2.5-7B(安全训练)和 Dolphin-Llama-3.1-8B(未审查)三款模型上测试检测与引导。检测方面:所有模型在最优层处的 AUROC 均为 0.996-1.00。未审查的 Dolphin 模型与安全训练的模型一致,表明同理心编码独立于安全训练而产生。Phi-3 的探针与 EIA 行为分数高度相关(r=0.71, p<0.01)。跨模型探针一致性有限(Qwen: r=-0.06, Dolphin: r=0.18),揭示尽管检测趋同,仍存在特定于架构的实现差异。引导方面:Qwen 实现 65.3% 的成功率,实现双向控制且保持连贯性。Phi-3 实现 61.7% 的成功率,类似的连贯性。Dolphin 显示出非对称的可操控性:对积极同理心引导实现 94.4% 的成功率,但对消极同理心引导出现灾难性崩溃(空输出、代码捷获)。含义:检测-引导之间的差距因模型而异。Qwen 和 Phi-3 维持双向连贯性;Dolphin 仅在同理心增强方面表现出鲁棒性。安全训练可能影响引导的鲁棒性而非防止操控,尽管需要更多模型的验证。
引用
@article{arxiv.2511.16699,
title = {Detecting and Steering LLMs' Empathy in Action},
author = {Juan P. Cadile},
journal= {arXiv preprint arXiv:2511.16699},
year = {2025}
}
备注
14 pages, 9 figures