中文

社会情感响应生成:面向基于大语言模型的对话系统的人机评估协议

计算与语言 2024-12-09 v1 人工智能 人机交互 社会与信息网络

摘要

对话系统现在能够生成令人印象深刻且通常相关的响应。然而,我们对最先进的 大语言模型(LLM)背后的社会情感策略既没有可见性也没有控制权,这对其透明性以及因此在关键应用中的可信性构成了问题。另一个问题是,当前的自动评估指标无法在数据集真实标签之外正确评估生成响应的质量。在本文中,我们提出了一种神经网络架构,该架构在响应生成之前包含一个规划社会情感策略的中间步骤。我们将开源基线 LLM 的性能与这些相同模型经我们规划模块增强后的输出进行了对比。我们还对比了自动指标获得的输出与人工标注者提供的评估结果。我们描述了一种新型评估协议,包括粗粒度的连贯性评估,以及对响应在不同社会与情感标准上的细粒度标注。我们的研究表明,预测一系列期望的策略标签并利用该序列生成响应,比直接的端到端生成方案效果更好。它还揭示了当前用于生成内容的评估指标之间的分歧与局限。标注平台代码和标注数据已公开发布,供未来模型的评估使用。

关键词

引用

@article{arxiv.2412.04492,
  title  = {Socio-Emotional Response Generation: A Human Evaluation Protocol for LLM-Based Conversational Systems},
  author = {Lorraine Vanel and Ariel R. Ramos Vela and Alya Yacoubi and Chloé Clavel},
  journal= {arXiv preprint arXiv:2412.04492},
  year   = {2024}
}