临床访谈抑郁检测基准的多探针审计
计算与语言
2026-05-26 v1 声音
音频与语音处理
摘要
本文通过四个互补探针对 DAIC/E-DAIC、CMDC、ANDROIDS、MODMA 和 PDCH 进行基准评估审计。首先,在严格的主体离散留单主体交叉验证下重新评估 E-DAIC,一个轻量级的混合文本-plus-LLM-score 模型达到宏观 F1=0.723——据我们所知,这是该协议下最高的保守参考点,不依赖特权官方留置。其次,我们测试 E-DAIC 官方分割是否支持细粒度排行榜排序,通过在模态束、池化策略和学习器之间扫过 96 个模型配置。开发侧交叉验证和官方测试排名仅中等程度地一致:最佳交叉验证配置在官方测试中排第 20,官方测试获胜者按交叉验证排名第 41,前 3 名重叠为零,表面上获胜者仅在 32.3% 的主体自助抽样中排第 1。第三,我们对强大的公开 CMDC 和 ANDROIDS 基线进行外部验证,这些基线在数据内表现接近极限。零样本迁移到外部语料库显著较弱。第四,我们使用由 SRDS 基于主体定义的症状密集型与症状轻型访谈片段对 E-DAIC 文本和音频模型进行压力测试。文本得分在症状密集型片段上显著上升,而音频得分几乎不变;文本减去音频的差距在所有五个随机种子中均为正。
引用
@article{arxiv.2605.23977,
title = {A Multi-Probe Audit of Clinical-Interview Depression Detection Benchmarks},
author = {Takehiro Ishikawa and Jon Duke},
journal= {arXiv preprint arXiv:2605.23977},
year = {2026}
}