中文

从视觉感知到深度共情:基于多模态大语言模型与多智能体协作的房树人绘画自动评估框架

人工智能 2025-12-29 v1 系统与控制 系统与控制

摘要

背景:房树人(HTP)绘画测试由John Buck于1948年提出,至今仍是临床心理学中广泛使用的投射技术。然而,它长期面临评分标准不一致、依赖检查者主观经验以及缺乏统一量化编码系统等挑战。结果:定量实验表明,多模态大语言模型(MLLM)解释与人类专家解释之间的平均语义相似度约为0.75(标准差约0.05)。在结构导向的专家数据集中,该相似度上升至0.85,表明达到了专家水平的基线理解。定性分析显示,多智能体系统通过整合社会心理学视角和去污名化叙事,有效纠正了视觉幻觉,并生成了具有高生态效度和内部一致性的心理报告。结论:研究结果证实了多模态大模型作为投射评估标准化工具的潜力。所提出的多智能体框架通过角色分工,将特征识别与心理推理解耦,为数字心理健康服务提供了新范式。

关键词

引用

@article{arxiv.2512.21360,
  title  = {From Visual Perception to Deep Empathy: An Automated Assessment Framework for House-Tree-Person Drawings Using Multimodal LLMs and Multi-Agent Collaboration},
  author = {Shuide Wen and Yu Sun and Beier Ku and Zhi Gao and Lijun Ma and Yang Yang and Can Jiao},
  journal= {arXiv preprint arXiv:2512.21360},
  year   = {2025}
}

备注

16 pages, 8 figures