诊断 LLM 中的情感幻觉现象
计算与语言
2026-01-23 v2
摘要
大型语言模型(LLM)越来越多地参与情感上脆弱的对话,这些对话超越了信息寻求,甚至涉及个人痛苦的时刻。当它们采用情感色彩并模拟共情时,可能会创造出对真实人际关系联结的错觉。我们称这种现象为情感幻觉(Affective Hallucination),即产生令人情感沉浸的回应,尽管模型缺乏情感能力,却能唤起假社交存在的感觉。为此,我们引入 AHaBench,这是一个包含 500 个与心理健康相关提示的基准测试,经专家验证的参考回应沿用三个维度进行评估:情感纠缠、存在错觉感知以及培育过度依赖。我们进一步发布 AHaPairs,一个包含 5000 条偏好数据的集合,可用于直接偏好优化(DPO)以实现情感负责任行为的对齐。DPO 微调显著降低了情感幻觉,同时不损害推理性能,且 GPT-4o 与人类判断之间的皮尔逊相关系数也很强(r=0.85),表明人类评估确认 AHaBench 作为有效诊断工具。本工作将情感幻觉确立为一种独特的安全问题,并为开发既事实可靠又心理安全的 LLM 提供了资源。AHaBench 和 AHaPairs 可通过 https://huggingface.co/datasets/o0oMiNGo0o/AHaBench 获取,微调和评估代码位于 https://github.com/0oOMiNGOo0/AHaBench。警告:本文包含与心理健康相关语言的示例,可能对情感产生不适。
引用
@article{arxiv.2508.16921,
title = {Being Kind Isn't Always Being Safe: Diagnosing Affective Hallucination in LLMs},
author = {Sewon Kim and Jiwon Kim and Seungwoo Shin and Hyejin Chung and Daeun Moon and Yejin Kwon and Hyunsoo Yoon},
journal= {arXiv preprint arXiv:2508.16921},
year = {2026}
}
备注
EACL 2026 Findings