基于多智能体语言模型的自然语音日记中幻觉相关内容的自动检测与分类
人工智能
2026-05-26 v1 计算与语言
摘要
在自然环境中记录的语音独白提供了表征精神疾病现象学和检测症状恶化的机会。大型语言模型(LLM)为自动化这一过程提供了新可能,因为它们主要需要针对评估而非训练进行标注。本文提出一种新型自动化、多智能体 LLM 管道,用于从记录自然语音日记的转录稿中提取细粒度、多标签的、暗示幻觉信念、相关情感反应和行为反应的语言。评估由三基座模型组成的集成,我们展示,详细的诊断提示指令成功地降低了幻觉主题分类的误报率,但也限制了对情感或行为反应的解释。此外,比较多智能体裁决框架显示,复杂的智能体间对话在降低临床模糊文本的准确率方面会导致过早的共识。相反,多数投票建立了稳健的性能(幻觉检测的 Micro F1 为 0.872,分类为 0.779)。本工作提供了一个经过验证且可扩展的管道,用于自动检测和表征自然语音中暗示幻觉信念内容。
引用
@article{arxiv.2605.24755,
title = {Automated Detection and Classification of Delusion-related Content in Naturalistic Audio Diaries Using Multi-Agent Language Models},
author = {Feng Chen and Justin Tauscher and Changye Li and Meliha Yetisgen and Alex Cohen and Adam Kuczynski and Angelina Pei-Tzu Tsai and Benjamin Buck and Dror Ben-Zeev and Trevor Cohen},
journal= {arXiv preprint arXiv:2605.24755},
year = {2026}
}
备注
Accepted by CLPych 2026