中文

MoodBench 1.0:情感陪伴式对话系统的评估基准

人工智能 2025-11-25 v1 人机交互

摘要

随着大型语言模型的快速发展,对话系统正从信息工具转向情感陪伴,这预示着情感陪伴式对话系统 (ECD) 的时代,即为用户提供个性化情感支持。然而,领域缺乏对 ECD 的清晰定义和系统评估标准。为此,我们首先提出了 ECD 的定义并给出形式化描述。随后,基于该理论和“能力层-任务层(三级)-数据层-方法层”的设计原则,我们设计并实现了第一个 ECD 评估基准 —— MoodBench 1.0。通过对 30 个主流模型的广泛评估,我们表明 MoodBench 1.0 拥有优异的判别有效性,并且能够有效量化模型在情感陪伶能力上的差异。此外,结果揭示了当前模型在深层情感陪伶方面的不足,指导了未来技术优化,并显著帮助开发人员提升 ECD 的用户体验。

关键词

引用

@article{arxiv.2511.18926,
  title  = {MoodBench 1.0: An Evaluation Benchmark for Emotional Companionship Dialogue Systems},
  author = {Haifeng Jing and Yujie Hou and Junfei Liu and Rui Xie and alan Xu and Jinlong Ma and Qichun Deng},
  journal= {arXiv preprint arXiv:2511.18926},
  year   = {2025}
}

备注

26 pages, 7 figures