中文

自验证改进少样本临床信息抽取

计算与语言 2023-06-21 v1 机器学习

摘要

从非结构化文本中抽取患者信息是健康决策支持与临床研究中的关键任务。大型语言模型(LLMs)已展现出通过少样本上下文学习加速临床整理的潜力,这与需要更昂贵人工标注的监督学习形成对比。然而,尽管以 GPT-4 为代表的现代 LLMs 取得巨大进展,它们仍在准确性与可解释性方面存在困难,尤其在健康等任务关键领域。在此,我们探索一种使用自验证的通用缓解框架,其利用 LLM 为其自身抽取提供出处并核查自身输出。这得益于验证与生成之间的不对称性,其中后者通常比前者容易得多。实验结果表明,我们的方法在标准临床信息抽取任务中持续提升了多种 LLMs 的准确度。此外,自验证以对应于每个输出的短文本片段形式产生解释,使人类专家审核结果非常高效,为资源受限场景下可信临床信息抽取铺平道路。为促进该方向的未来研究,我们发布了代码与提示。

关键词

引用

@article{arxiv.2306.00024,
  title  = {Self-Verification Improves Few-Shot Clinical Information Extraction},
  author = {Zelalem Gero and Chandan Singh and Hao Cheng and Tristan Naumann and Michel Galley and Jianfeng Gao and Hoifung Poon},
  journal= {arXiv preprint arXiv:2306.00024},
  year   = {2023}
}