ESC-Judge:用于比较情感支持对话代理的框架
计算与语言
2025-05-20 v1
摘要
大型语言模型(LLM)日益驱动心理健康聊天机器人,但该领域仍缺乏一种可扩展且基于理论的评估方法,以决定哪种模型最适合部署。我们提出ESC-Judge,这是第一个实现端到端的评估框架,能够:(i)以Clara Hill的 established Exploration-Insight-Action咨询模型为基础,对情感支持LLM进行头战比较,提供结构化且可解释的性能视图;(ii)在规模上完全自动化评估流程。ESC-Judge包含三个阶段:首先,通过抽取如压力源、性格和生活历史等经验显著属性来合成真实的求助者角色;其次,让两个候选支持代理分别与同一角色进行独立会话,以隔离模型特定策略;最后,要求专业评判LLM在探索、洞察和行动光谱上的 rubric-anchored技能进行两两偏好表达。在我们的研究中,ESC-Judge在探索、洞察和行动决策中分别与博士级标注员一致率达到85%、83%和86%,显示出以更低成本实现的人类水平可靠性。我们发布所有代码、提示、合成角色、转录和判断脚本,以促进情感支持AI领域的透明进展。
关键词
引用
@article{arxiv.2505.12531,
title = {ESC-Judge: A Framework for Comparing Emotional Support Conversational Agents},
author = {Navid Madani and Rohini Srihari},
journal= {arXiv preprint arXiv:2505.12531},
year = {2025}
}