中文

评估基于文本的情感健康对话代理:系统综述中的指标、方法与使用情境

人机交互 2026-02-23 v1

摘要

基于文本的情感健康对话代理 (conversational agents, CAs) 正在增长地使用,但评估实践仍然不完整。我们进行了一次受 PRISMA 指导的系统综述(2024 年 5 月至 6 月),在 ACM Digital Library、Scopus 和 PsycINFO 中检索。从 613 条记录中纳入 132 项研究,双编码提取实现了显著一致性(Cohen's kappa = 0.77-0.92)。我们综合了评估方法的三个维度:指标、方法和使用情境。将指标分为 CA 相关属性(如可靠性、安全性、同情心)和用户相关结果(体验、知识、心理状态、健康行为)。方法包括自动分析、标准心理测量量表和定性探讨。时间设计范围从瞬时到随访评估。研究结果显示,依赖西方开发的量表、文化适应有限、样本规模和短期为主,以及自动性能指标与用户幸福感之间的弱联系。我们主张进行方法论三角测量、时间严谨性以及测量的平等性。这项综述为可靠、安全和以用户为中心的情感健康对话代理评估提供了结构化基础。

关键词

引用

@article{arxiv.2602.17669,
  title  = {Evaluating Text-based Conversational Agents for Mental Health: A Systematic Review of Metrics, Methods and Usage Contexts},
  author = {Jiangtao Gong and Xiao Wen and Fengyi Tao and Xinqi Wang and Xixi Yang and Yangrong Tang},
  journal= {arXiv preprint arXiv:2602.17669},
  year   = {2026}
}

备注

17 pages, 1 figures