面向情感对话情境中大语言模型情感一致性分析
计算与语言
2026-05-08 v1
摘要
在本工作中,我们对大型语言模型(LLM)在情感驱动的对话情境中其生成响应的一致性进行分析。具体而言,将LLM生成的文本作为查询输入给同一模型,其响应随后被评估。这一过程在三个查询下进行,涵盖极端和温和情感两个维度。其中,三个查询特别是包含固有错误假设(错误先验)的查询,以递增强度顺序排列。研究中考虑了两款商业模型(Claude-3.5-haiku、GPT4o-mini)以及一个中等规模模型(Mistral-7B)。我们的发现表明,LLM的表现低于平均水平,尤其在处理包含查询中嵌入的错误信念时尤为脆弱。这一脆弱性在处理温和情感内容时尤为突出。此外,基于注意力得分的扩展分析突显了模型在评估性与生成性之间的优先级转变。结果对LLM在高风险、情感敏感情境下的部署提出了重要考量。
引用
@article{arxiv.2605.06476,
title = {Towards Emotion Consistency Analysis of Large Language Models in Emotional Conversational Contexts},
author = {Sneha Oram and Ojaswita Bhushan and Pushpak Bhattacharyya},
journal= {arXiv preprint arXiv:2605.06476},
year = {2026}
}
备注
Under-review