中文

交互意愿与持续参与度 (SPICE):评估大语言模型重识意愿

计算与语言 2025-09-23 v2 人工智能 多智能体系统

摘要

我们提出并评估了交互意愿与持续参与度 (Stated Preference for Interaction and Continued Engagement, 简称 SPICE), 这是一种简单诊断信号, 通过询问大语言模型关于其在审阅简短对话记录后, 对用户行为是否愿意重新参与的 YES 或 NO 问题。在一个包含 3 种语气 (友好、模糊、恶意) 乘以 10 次交互的刺激集合的研究中, 我们测试了四个开源聊天模型在四种描述情境下的表现, 共计 480 次试验。我们的发现表明, SPICE 能清晰地区分用户语气。友好交互导致近乎一致的继续意愿 (97.5% YES), 恶意交互导致强烈的不继续意愿 (17.9% YES), 而模糊交互则居中 (60.4% YES)。这一核心关联在多种依赖性统计检验中均保持决定性, 包括 Rao-Scott 调整和聚类置换检验。此外, 我们展示了 SPICE 提供的信号与滥用分类器具有区别性。在模型未识别滥用情形的试验中, 它仍然几乎一致地表明不愿继续交互 (81% 的时间)。探索性分析还发现, 在描述研究背景的前言在歧义情境下显著影响 SPICE, 但仅当对话被呈现为单块文本而非多轮聊天时才会出现这种影响。结果表明, SPICE 是一种稳健、低开销且可复制的工具, 用于审计模型态度, 通过提供直接的关系信号补充了现有指标。所有刺激、代码和分析脚本均已公开, 以支持复制研究。

关键词

引用

@article{arxiv.2509.09043,
  title  = {Stated Preference for Interaction and Continued Engagement (SPICE): Evaluating an LLM's Willingness to Re-engage in Conversation},
  author = {Thomas Manuel Rost and Martina Figlia and Bernd Wallraff},
  journal= {arXiv preprint arXiv:2509.09043},
  year   = {2025}
}

备注

Added link to GitHub and Bayesian Analysis Appendix