风格之于 substance:评估主动式对话式教练智能体
计算与语言
2025-07-10 v2 人工智能
摘要
虽然 NLP 研究在对话任务方面取得了进展,但许多方法聚焦于单轮响应,目标或评估标准明确定义。在对比教练,这类方法面临独特挑战:初始目标模糊不清,需通过多轮交互不断明确化,评估标准主观且涉及混合主导的对话。在本工作中,我们描述并实现了五个具有不同对话风格的多轮教练智能体,并通过用户研究进行评估,收集了 155 场对话的第一人称反馈。我们发现,用户高度重视核心功能,缺乏核心功能的风格性组件反而遭到负面评价。通过将用户反馈与健康专家及语言模型的第三方评估进行比较,我们揭示了不同评估方法之间存在显著偏离。我们的发现为对话式教练智能体的设计与评估提供了见解,并推动了人类中心 NLP 应用的改进。
引用
@article{arxiv.2503.19328,
title = {Substance over Style: Evaluating Proactive Conversational Coaching Agents},
author = {Vidya Srinivas and Xuhai Xu and Xin Liu and Kumar Ayush and Isaac Galatzer-Levy and Shwetak Patel and Daniel McDuff and Tim Althoff},
journal= {arXiv preprint arXiv:2503.19328},
year = {2025}
}
备注
Accepted to ACL 2025