情感弧比较:真实与LLM生成的CBT会话
计算与语言
2025-12-18 v3
摘要
由大型语言模型(LLM)生成的合成治疗对话日益增多,常用于心理健康NLP中模拟咨询场景、训练模型以及补充有限的真实世界数据。然而,这些合成对话是否捕捉到真实治疗中细腻的情感动态仍不明确。本文引入RealCBT数据集,包含真实认知行为疗法(CBT)对话,并对真实与LLM生成的CBT会话情感弧进行首次比较分析。我们采用utterance情感动态框架,对 valence、arousal和dominance三个维度上的细粒度情感轨迹进行分析。我们的分析涵盖完整对话和说话者角色(顾问员和客户)两方面,分别使用RealCBT数据集中的真实会话和CACTUS数据集中的合成对话。我们发现,尽管合成对话在流畅性和结构连贯性方面表现良好,但在关键情感属性上与真实对话存在差异:真实会话表现出更大的情感波动、更多情感语言以及更真实的反应和调节模式。此外,所有配对之间的情感弧相似性都很低,尤其是在真实与合成说话者之间存在极弱的一致性。这些发现凸显了当前LLM生成治疗数据的局限性,强调在心理健康应用中情感保真度的重要性。为支持未来研究,我们将RealCBT数据集发布于https://gitlab.com/xiaoyi.wang/realcbt-dataset。
引用
@article{arxiv.2508.20764,
title = {Feel the Difference? A Comparative Analysis of Emotional Arcs in Real and LLM-Generated CBT Sessions},
author = {Xiaoyi Wang and Jiwei Zhang and Guangtao Zhang and Honglei Guo},
journal= {arXiv preprint arXiv:2508.20764},
year = {2025}
}
备注
Accepted at 2025 EMNLP findings,19 page,2 figures