中文

FEEL: 一个基于大语言模型评估情感支持能力的框架

计算与语言 2024-08-05 v3

摘要

情感支持对话(ESC)是一种典型的对话,可以有效帮助用户缓解情绪压力。然而,由于分析情感时固有的主观性,当前的非人工方法在有效评估情感支持能力方面面临挑战。这些指标与人类判断的相关性较低。同时,人工评估方法会带来高昂的成本。为了解决这些问题,我们提出了一种新颖的模型FEEL(基于大语言模型的情感支持能力评估框架),使用大语言模型(LLM)作为评估者来评估情感支持能力。该模型仔细考虑了ESC的各个评估方面,为ESC应用更全面、更准确的评估方法。此外,它采用概率分布方法以获得更稳定的结果,并集成了集成学习策略,利用多个具有分配权重的LLM来提高评估准确性。为了评估FEEL的性能,我们在现有的ESC模型对话上进行了大量实验。实验结果表明,与基线相比,我们的模型在与人类评估的一致性方面表现出显著提升。我们的源代码可在https://github.com/Ansisy/FEEL获取。

关键词

引用

@article{arxiv.2403.15699,
  title  = {FEEL: A Framework for Evaluating Emotional Support Capability with Large Language Models},
  author = {Huaiwen Zhang and Yu Chen and Ming Wang and Shi Feng},
  journal= {arXiv preprint arXiv:2403.15699},
  year   = {2024}
}

备注

Accepted to ICIC 2024