中文

合成治疗对话多真实?评估延长暴露对话的忠实度

计算与语言 2025-09-23 v4 人工智能 计算机与社会 人机交互

摘要

合成数据采用由隐私 concerns、数据获取限制和高标注成本驱动。我们探索用于PTSD的延长暴露(Prolonged Exposure, PE)治疗对话的合成替代方案,以规模化训练临床模型。我们系统比较了真实与合成对话,采用语言学、结构和特定于协议的指标,如轮次和治疗忠实度。我们引入并评估了PE特定的指标,提供了一个用于评估临床忠实度的新框架,超越表面流畅度。我们的发现表明,尽管合成数据成功缓解了数据稀缺问题并保护了隐私,但捕捉最细微的治疗动力学仍是一个复杂挑战。合成对话成功复制了真实对话的关键语言特征,例如在可读性评分上实现了相似水平(89.2 vs. 88.1),同时在某些关键忠实度标记上存在差异,如症状监测。此比较凸显了需要超越表面流畅度的忠实度感知指标,以识别临床上关键细微差别的需求。我们提供的模型无关框架是开发者和临床工作者在部署于敏感应用程序之前对生成模型忠实度进行基准测试的关键工具。我们的发现帮助阐明了合成数据在何处可以有效补充真实数据集,同时也识别了未来改进的领域。

关键词

引用

@article{arxiv.2504.21800,
  title  = {How Real Are Synthetic Therapy Conversations? Evaluating Fidelity in Prolonged Exposure Dialogues},
  author = {Suhas BN and Dominik Mattioli and Saeed Abdullah and Rosa I. Arriaga and Chris W. Wiese and Andrew M. Sherrill},
  journal= {arXiv preprint arXiv:2504.21800},
  year   = {2025}
}

备注

10 pages, 5 tables. Accepted for Poster presentation at EMNLP 2025