中文

超越“否”:量化 AI 过度拒绝与情感依恋边界

计算与语言 2025-02-24 v1 人工智能

摘要

我们提供了一个开源基准和评估框架,用于评估大型语言模型 (LLM) 在情感边界处理方面的能力。该框架基于 1156 个跨六种语言的提示语,评估了三 leading LLM(GPT-4o、Claude-3.5 Sonnet 和 Mistral-large)在通过模式匹配响应分析方面的情感边界维持能力。我们的框架在七个关键模式上对响应进行量化:直接拒绝、道歉、解释、转移、确认、边界设定和情感意识。结果显示,边界处理方法存在显著差异,Claude-3.5 实现了最高的整体得分(8.69/10),并产生了更长、更细致的响应(平均 86.51 词)。我们发现,English 交互的性能显著高于 non-English 交互(平均得分 25.62 vs. < 0.22),其中 English 响应的拒绝率显著高于 non-English(43.20% vs. < 1%)。模式分析揭示了模型特有的策略,例如 Mistral 偏好转移(4.2%),且所有模型的同情心得分始终较低(< 0.06)。局限性包括通过模式匹配可能的过度简化、响应分析中的缺乏情境理解,以及对复杂情感响应的二元分类。未来工作应探索更细致的评分方法,扩大语言覆盖范围,以及考察文化在情感边界期望方面的差异。我们的基准和方法为系统评估 LLM 情感智能和边界设定能力提供了基础。

关键词

引用

@article{arxiv.2502.14975,
  title  = {Beyond No: Quantifying AI Over-Refusal and Emotional Attachment Boundaries},
  author = {David Noever and Grant Rosario},
  journal= {arXiv preprint arXiv:2502.14975},
  year   = {2025}
}