中文

基于多智能体协作的 PHI 去识别模型自动评估与选择

人工智能 2025-11-19 v2

摘要

受保护健康信息 (PHI) 的去识别对于启用临床笔记的安全重用至关重要,但评估和比较 PHI 去识别模型通常依赖昂贵且规模小的专家标注。我们提出了 TEAM-PHI,一个基于大语言模型 (LLM) 的多智能体评估与选择框架,用于自动衡量去识别质量并在缺乏大量标注的情况下选择表现最佳的模型。TEAM-PHI 部署多个评估智能体,独立判断 PHI 提取的正确性,并输出结构化指标。随后通过基于 LLM 的多数投票机制整合这些结果,将多元化评估者视角整合为单一、稳定且可复现的排名。在真实世界临床笔记语料库上的实验表明,TEAM-PHI 产生了一致且准确的排名:尽管个别评估者之间存在差异,基于 LLM 的投票能够可靠地收敛至相同的顶级系统。进一步与真实标签和人类评估的比较确认,该框架的自动化排名与受监督评估 closely match。通过将独立评估智能体与 LLM 多数投票相结合,TEAM-PHI 提供了一个在 PHI 去识别中实现自动化评估和最佳模型选择的实用、安全且高性价比的解决方案,即使在标注有限的情况下也能发挥作用。

关键词

引用

@article{arxiv.2510.16194,
  title  = {Towards Automatic Evaluation and Selection of PHI De-identification Models via Multi-Agent Collaboration},
  author = {Guanchen Wu and Zuhui Chen and Yuzhang Xie and Carl Yang},
  journal= {arXiv preprint arXiv:2510.16194},
  year   = {2025}
}

备注

Agents4Science 2025 (Spotlight)