中文

面向对话系统评估的心理学度量指标

计算与语言 2023-09-19 v2

摘要

我们提出通过心理学基础的“拟人”视角来评估对话系统的度量指标,其中对话智能体如同人类一样表达状态(如情绪)与特质(如性格)的多样性。我们提出五个来自成熟心理学的、对人类沟通与关系至关重要的可解释度量指标:情绪熵、语言风格与情绪匹配、宜人性以及共情。这些指标可应用于(1)跨对话层面以及(2)对话内轮次层面。我们在七个标准对话系统数据集上将心理学度量指标与七个最先进的传统度量指标(如 BARTScore 和 BLEURT)进行比较。我们还引入一个新的数据集——三机器人对话评估语料库(Three Bot Dialog Evaluation Corpus),其由来自 ChatGPT、GPT-3 和 BlenderBot 的带标注对话组成。我们证明所提度量指标提供了新颖信息:它们与传统度量指标不相关,可用于有意义地比较对话系统,并在预测众包对话评判时较现有传统度量指标提升准确性。我们心理学度量指标的可解释性与独特信号使其成为评估和改进行对话系统的宝贵工具。

关键词

引用

@article{arxiv.2305.14757,
  title  = {Psychological Metrics for Dialog System Evaluation},
  author = {Salvatore Giorgi and Shreya Havaldar and Farhan Ahmed and Zuhaib Akhtar and Shalaka Vaidya and Gary Pan and Lyle H. Ungar and H. Andrew Schwartz and Joao Sedoc},
  journal= {arXiv preprint arXiv:2305.14757},
  year   = {2023}
}