CBT-Audio:用于评估基于音频的语言模型在 CBT 会议记录中患者-side 不安强度估计
人工智能
2026-05-20 v2
摘要
认知行为疗法广泛用于帮助患者理解和管理心理不安。它通常通过语音对话进行,治疗师不仅关注患者说的内容,还关注说话的方式,因为这些线索有助于治疗师决定如何响应和调整治疗方案。进步主要局限于文本,部分原因是大多数可用数据集基于文本且在伦理和隐私约束下难以获取可共享的语音 CBT 数据。这导致一个盲区,因为基于文本的模型和评估无法捕捉转录与患者语音之间的偏差,尽管治疗师常依赖此偏差来理解患者不安。我们引入 CBT-Audio,一个用于评估患者不安程度的音频语言模型数据集。CBT-Audio 包含 1,802 条来自 96 项公开 CBT 记录的患者发言,带有经专家标注子验证的转轮级不安标签。我们评估了 10 个开源音频语言模型,模型在三种输入条件下运行:仅接收患者音频、仅接收转录文本或同时接收音频和转录文本。我们的结果表明,音频可以提供超出文本的有用信息,尤其是在与转录文本组合时。将音频添加到转录输入可在 80% 的模型家族中提高不安估计,其中 4 项显示显著提升,案例研究显示在语言内容与语音表达差异时获益最明显。CBT-Audio 使基于语言模型的患者语音行为可测量,支持心理健康交互相关任务中 AI 评估的未来工作。
引用
@article{arxiv.2605.17370,
title = {CBT-Audio: Evaluating Audio Language Models for Patient-Side Distress Intensity Estimation in CBT Session Recordings},
author = {Qixuan Hu and Shuchang Ye and Xumou Zhang and Anastasia Serafimovska and Anastasia Suraev and Amit Saha and Ping-hsiu Lin and Sydney Su and Usman Naseem and Adam G. Dunn and Jinman Kim},
journal= {arXiv preprint arXiv:2605.17370},
year = {2026}
}
备注
9 pages, 3 figures, 2 tables